Цели урока
- Переранжирование результатов лексического/семантического поиска
- Переранжирование полуструктурированных данных
- Переранжирование табличных данных
- Многоязычное переранжирование
О чём урок
Переранжирование — это техника, которая обеспечивает семантическое улучшение качества поиска любой системы поиска по ключевым словам или векторного поиска, и особенно полезна в системах RAG. Мы можем переранжировать результаты семантического поиска, а также любых других поисковых систем, таких как лексический поиск. Это означает, что компании могут сохранить существующую систему поиска по ключевым словам (также называемую «лексической») или семантического поиска для первого этапа извлечения и интегрировать конечную точку Rerank во второй этап переранжирования. В этом учебнике вы узнаете о следующем: Вы изучите это, создав помощника по адаптации для новых сотрудников. Для начала нам необходимо установить библиотеку cohere и создать клиент Cohere. Rerank требует всего одной строки кода для реализации. Предположим, у нас есть список результатов поиска по часто задаваемым вопросам, который может быть получен из семантических, лексических или любых других типов поисковых систем. Но этот список может быть неоптимально ранжирован по релевантности для запроса пользователя. Здесь может помочь Rerank. Мы вызываем конечную точку с помощью co.rerank() и передаем следующие аргументы: query: Запрос пользователя documents: Список документов top_n: Количество лучших переранжированных документов для выбора model: Мы выбираем Rerank English 3 Дополнительная литература: Справочник по API конечной точки Rerank Документация по Rerank Документация по тонкой настройке Rerank Документация по лучшим практикам Rerank Модуль LLM University по представлению текста Модель Rerank 3 поддерживает многоаспектные и полуструктурированные данные, такие как электронные письма, счета-фактуры, документы JSON, код и таблицы. Установив поля ранжирования, вы можете выбрать, какие поля модель должна учитывать при переранжировании. В следующем примере мы используем данные электронных писем. Это полуструктурированные данные, которые содержат ряд полей – from, to, date, subject и text. Предположим, новый сотрудник теперь хочет найти электронные письма о встречах для проверки прогресса. Давайте представим, что у нас есть список из 5 электронных писем, полученных из API поставщика электронной почты.
План урока
- Настройка
- Переранжирование результатов лексического/семантического поиска
- Переранжирование полуструктурированных данных
- Переранжирование табличных данных
- Многоязычное переранжирование
- Заключение
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.