О чём урок
В этом руководстве вы узнаете, как использовать OpenAI Embedding API для генерации языковых embedding'ов, а затем индексировать эти embedding'и в векторной базе данных Pinecone для быстрого и масштабируемого векторного поиска. Это мощная и распространённая комбинация для создания систем семантического поиска, ответов на вопросы, обнаружения угроз и других приложений, которые полагаются на NLP и поиск по большому корпусу текстовых данных. Базовый workflow выглядит следующим образом: Создание embedding'ов и индексация Используйте OpenAI Embedding API для генерации векторных embedding'ов ваших документов (или любых текстовых данных). Загрузите эти векторные embedding'и в Pinecone, которая может хранить и индексировать миллионы/миллиарды таких векторных embedding'ов, и выполнять поиск по ним с ультранизкими задержками. Поиск Передайте ваш запрос (текст или документ) через OpenAI Embedding API ещё раз. Возьмите полученный векторный embedding и отправьте его в Pinecone в качестве запроса. Получите семантически схожие документы, даже если они не содержат общих ключевых слов с запросом. Давайте начнём... Сначала нам нужно настроить наше окружение и получить API ключи для OpenAI и Pinecone. Начнём с окружения: нам понадобятся HuggingFace Datasets для наших данных, а также клиенты OpenAI и Pinecone: Затем мы инициализируем наше соединение с OpenAI Embeddings и векторной базой данных Pinecone. Зарегистрируйтесь для получения API ключа на OpenAI и Pinecone.
План урока
- Настройка
- Создание Embedding'ов
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.