О чём урок
В этом кратком руководстве вы узнаете, как создать "поисковик и генератор философских цитат" используя векторные embedding'и OpenAI и DataStax Astra DB в качестве векторного хранилища для обеспечения сохранности данных. Ниже описан основной рабочий процесс этого notebook. Вы оцените и сохраните векторные embedding'и для ряда цитат известных философов, используете их для создания мощной поисковой системы, а затем даже генератора новых цитат! Этот notebook демонстрирует некоторые стандартные шаблоны использования векторного поиска, показывая, насколько легко начать работу с Astra DB. Для получения дополнительной информации об использовании векторного поиска и текстовых embedding'ов для создания системы вопросов и ответов, пожалуйста, ознакомьтесь с этим превосходным практическим notebook: Question answering using embeddings. Содержание: Настройка Создание векторной коллекции Подключение к OpenAI цитат в векторное хранилище Вариант использования 1: поисковая система цитат Вариант использования 2: генератор цитат Очистка Индексация Каждая цитата преобразуется в векторный embedding с помощью Embedding от OpenAI. Они сохраняются в векторном хранилище для последующего использования в поиске. Некоторые метаданные, включая имя автора и несколько других предварительно вычисленных тегов, хранятся рядом, чтобы обеспечить настройку поиска. Поиск Чтобы найти цитату, похожую на заданную поисковую цитату, последняя на лету преобразуется в векторный embedding, и этот вектор используется для запроса к хранилищу на предмет похожих векторов... то есть похожих цитат, которые были проиндексированы ранее. Поиск может быть опционально ограничен дополнительными метаданными ("найди мне цитаты Спинозы, похожие на эту..."). Ключевой момент здесь заключается в том, что "цитаты, схожие по содержанию" в векторном пространстве соответствуют векторам, которые метрически близки друг к другу: таким образом, поиск по векторному сходству эффективно реализует семантическое сходство. В этом и заключается основная причина такой мощи векторных embedding'ов. Приведенный ниже эскиз пытается передать эту идею. Каждая цитата, будучи преобразованной в вектор, представляет собой точку в пространстве. В данном случае это точка на сфере, поскольку векторные embedding'и OpenAI, как и большинство других, нормализованы до единичной длины.
План урока
- Версия AstraPy
- Принцип работы
- Настройка
- Параметры подключения
- Создание экземпляра клиента Astra DB
- Создание векторной коллекции
- Подключение к OpenAI
- Настройка секретного ключа
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.