Цели урока
- Векторизация документов
- Векторизация запроса
- Выполнение семантического поиска
- Многоязычный семантический поиск
- Изменение типов сжатия embeddings
О чём урок
Векторные представления текста (text embeddings) — это список чисел, которые представляют контекст или значение фрагмента текста. Это особенно полезно в приложениях поиска или извлечения информации. При использовании векторных представлений текста это называется семантическим поиском. Семантический поиск решает проблему, с которой сталкивается более традиционный подход лексического поиска, который отлично справляется с поиском совпадений по ключевым словам, но с трудом улавливает контекст или значение фрагмента текста. С помощью Cohere вы можете генерировать text embeddings через Embed endpoint (Embed v3 — это последняя модель), который поддерживает более 100 языков. В этом учебном пособии вы узнаете о следующем: Вы изучите это, создавая помощника по адаптации для новых сотрудников. Для начала нам необходимо установить библиотеку cohere и создать клиент Cohere. Embed endpoint принимает тексты в качестве входных данных и возвращает embeddings в качестве выходных данных. Для семантического поиска существует два типа документов, которые нам необходимо преобразовать в embeddings. Список документов, по которым мы хотим выполнить поиск. Запрос, который будет использоваться для поиска по документам. Сейчас мы выполняем первое. Мы вызываем Embed endpoint с помощью co.embed() и передаем следующие аргументы: model: Здесь мы выбираем embed-v4.0 input_type: Мы выбираем search_document, чтобы модель рассматривала их как документы для поиска texts: Список текстов (FAQ) Дополнительная литература: Справочник по API Embed endpoint Документация по Embed endpoint Документация по моделям, доступным на Embed endpoint Модуль LLM University по представлению текста Далее мы добавляем запрос, который спрашивает о том, как оставаться в курсе новостей компании. Мы выбираем search_query в качестве input_type, чтобы модель рассматривала это как запрос (а не документы) для поиска. Теперь мы хотим найти наиболее релевантные документы по запросу. Мы делаем это, вычисляя сходство между embeddings запроса и каждого из документов. Существуют различные подходы для вычисления сходства между embeddings, и мы выберем подход с использованием скалярного произведения (dot product).
План урока
- Настройка
- Векторизация документов
- Векторизация запроса
- Выполнение семантического поиска
- Многоязычный семантический поиск
- Заключение
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.