Семантический поиск на Pinecone

Урок 273 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В этом руководстве вы узнаете, как использовать OpenAI Embedding API для генерации языковых embedding'ов, а затем индексировать эти embedding'и в векторной базе данных Pinecone для быстрого и масштабируемого векторного поиска. Это мощная и распространённая комбинация для создания систем семантического поиска, ответов на вопросы, обнаружения угроз и других приложений, которые полагаются на NLP и поиск по большому корпусу текстовых данных. Базовый workflow выглядит следующим образом: Создание embedding'ов и индексация Используйте OpenAI Embedding API для генерации векторных embedding'ов ваших документов (или любых текстовых данных). Загрузите эти векторные embedding'и в Pinecone, которая может хранить и индексировать миллионы/миллиарды таких векторных embedding'ов, и выполнять поиск по ним с ультранизкими задержками. Поиск Передайте ваш запрос (текст или документ) через OpenAI Embedding API ещё раз. Возьмите полученный векторный embedding и отправьте его в Pinecone в качестве запроса. Получите семантически схожие документы, даже если они не содержат общих ключевых слов с запросом. Давайте начнём... Сначала нам нужно настроить наше окружение и получить API ключи для OpenAI и Pinecone. Начнём с окружения: нам понадобятся HuggingFace Datasets для наших данных, а также клиенты OpenAI и Pinecone: Затем мы инициализируем наше соединение с OpenAI Embeddings и векторной базой данных Pinecone. Зарегистрируйтесь для получения API ключа на OpenAI и Pinecone.

План урока

  1. Настройка
  2. Создание Embedding'ов

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды