Философские цитаты на векторах и Cassandra

Урок 254 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В этом quickstart вы узнаете, как создать «поисковик и генератор философских цитат» с использованием векторных embedding'ов OpenAI и Apache Cassandra®, или, что эквивалентно, DataStax Astra DB через CQL, в качестве векторного хранилища для сохранения данных. Основной рабочий процесс этого notebook'а описан ниже. Вы оцените и сохраните векторные embedding'и для ряда цитат известных философов, используете их для создания мощной поисковой системы, а затем даже генератора новых цитат! Этот notebook демонстрирует некоторые стандартные сценарии использования векторного поиска — показывая, как легко начать работу с векторными возможностями Cassandra / Astra DB через CQL. Для получения дополнительной информации об использовании векторного поиска и текстовых embedding'ов для создания системы вопросов и ответов, пожалуйста, ознакомьтесь с этим превосходным практическим notebook'ом: Ответы на вопросы с использованием embedding'ов. Обратите внимание, что этот notebook использует драйверы Cassandra и напрямую выполняет операторы CQL (Cassandra Query Language), но мы рассматриваем и другие технологические решения для выполнения той же задачи. Ознакомьтесь с README этой папки для других вариантов. Этот notebook может быть запущен как Colab notebook, так и как обычный Jupyter notebook. Содержание: Настройка Получение подключения к БД Подключение к OpenAI цитат в Vector Store Сценарий использования 1: поисковая система цитат Сценарий использования 2: генератор цитат (Необязательно) использование партиционирования в Vector Store Индексирование Каждая цитата преобразуется в векторный embedding с помощью Embedding от OpenAI. Они сохраняются в Vector Store для последующего использования в поиске. Некоторые метаданные, включая имя автора и несколько других предварительно вычисленных тегов, хранятся рядом, чтобы обеспечить настройку поиска. Поиск Чтобы найти цитату, похожую на заданную поисковую цитату, последняя на лету преобразуется в векторный embedding, и этот вектор используется для запроса хранилища на предмет похожих векторов... то есть похожих цитат, которые были проиндексированы ранее. Поиск может быть опционально ограничен дополнительными метаданными («найди мне цитаты Спинозы, похожие на эту...»).

План урока

  1. Версия CQL
  2. Выберите свой фреймворк
  3. Как это работает
  4. Настройка
  5. Получение подключения к БД
  6. Создание подключения к БД
  7. Создание векторной таблицы в CQL
  8. Добавление векторного индекса для ANN поиска

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды