Цели урока
- Переранжирование результатов лексического/семантического поиска
- Переранжирование полуструктурированных данных
- Переранжирование табличных данных
- Многоязычное переранжирование
О чём урок
Переранжирование — это метод, который обеспечивает семантическое улучшение качества поиска любой системы поиска по ключевым словам или векторного поиска, и особенно полезен в системах RAG. Мы можем переранжировать результаты как семантического поиска, так и любых других поисковых систем, таких как лексический поиск. Это означает, что компании могут сохранить существующую систему поиска по ключевым словам (также называемую «лексической») или семантического поиска для первого этапа извлечения и интегрировать конечную точку Rerank во второй этап переранжирования. В этом руководстве вы узнаете о: Вы освоите это, создав помощника по адаптации для новых сотрудников. Для начала нам нужно установить библиотеку cohere и создать клиент Cohere. Rerank требует всего одной строки кода для реализации. Предположим, у нас есть список результатов поиска из списка часто задаваемых вопросов (FAQ), который может быть получен из семантических, лексических или любых других типов поисковых систем. Но этот список может быть неоптимально ранжирован по релевантности для запроса пользователя. Здесь Rerank может помочь. Мы вызываем конечную точку с помощью co.rerank() и передаем следующие аргументы: query: Запрос пользователя documents: Список документов top_n: Количество лучших переранжированных документов для выбора model: Мы выбираем Rerank English 3 Дополнительная литература: Rerank endpoint API reference Documentation on Rerank Documentation on Rerank fine-tuning Documentation on Rerank best practices LLM University module on Text Representation Модель Rerank 3 поддерживает многоаспектные и полуструктурированные данные, такие как электронные письма, счета, JSON-документы, код и таблицы. Установив поля ранжирования, вы можете выбрать, какие поля модель должна учитывать для переранжирования. В следующем примере мы используем данные электронного письма. Это полуструктурированные данные, которые содержат несколько полей – from, to, date, subject и text. Предположим, новый сотрудник теперь хочет найти электронные письма о встречах для проверки прогресса. Давайте представим, что у нас есть список из 5 электронных писем, полученных из API поставщика электронной почты.
План урока
- Настройка
- Переранжирование результатов лексического/семантического поиска
- Переранжирование полуструктурированных данных
- Переранжирование табличных данных
- Многоязычное переранжирование
- Заключение
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.