Ответы на вопросы через поисковый API и переранжирование

Урок 50 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Поиск релевантной информации иногда может напоминать поиск иголки в стоге сена, но не отчаивайтесь, GPT-модели могут выполнить значительную часть этой работы за нас. В этом руководстве мы рассмотрим способ расширения существующих поисковых систем с помощью различных методов ИИ, что поможет нам отсеять лишний шум. Существует два способа извлечения информации для GPT: Имитация человеческого просмотра: GPT инициирует поиск, оценивает результаты и при необходимости изменяет поисковый запрос. Он также может углубляться в конкретные результаты поиска, формируя цепочку рассуждений, подобно тому, как это сделал бы человек. Извлечение с помощью embeddings: Вычислите embeddings для вашего контента и пользовательского запроса, а затем извлеките наиболее релевантный контент, измеренный по косинусному сходству. Этот метод активно используется поисковыми системами, такими как Google. Оба этих подхода многообещающи, но каждый имеет свои недостатки: первый может быть медленным из-за его итеративного характера, а второй требует предварительного создания embeddings для всей вашей базы знаний, постоянного создания embeddings для нового контента и поддержания векторной базы данных. Комбинируя эти подходы и черпая вдохновение из методов переранжирования, мы определяем подход, который находится посередине. Этот подход может быть реализован поверх любой существующей поисковой системы, такой как search API Slack, или внутренней инсталляции ElasticSearch с приватными данными. Вот как это работает: Шаг 1: Поиск Пользователь задает вопрос. GPT генерирует список потенциальных запросов. Поисковые запросы выполняются параллельно. Шаг 2: Переранжирование Embeddings для каждого результата используются для расчета семантического сходства с сгенерированным гипотетическим идеальным ответом на вопрос пользователя. Результаты ранжируются и фильтруются на основе этой метрики сходства. Шаг 3: Ответ На основе лучших результатов поиска модель генерирует ответ на вопрос пользователя, включая ссылки и источники. Этот гибридный подход обеспечивает относительно низкую задержку и может быть интегрирован в любую существующую конечную точку поиска, не требуя поддержки векторной базы данных. Давайте углубимся в это! В качестве примера домена для поиска мы будем использовать News API.

План урока

  1. Настройка
  2. 1. Поиск
  3. 2. Переранжирование
  4. 3. Ответ

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды