Первые шаги с Milvus

Урок 264 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В этом notebook мы рассмотрим генерацию embedding'ов описаний книг с помощью OpenAI и использование этих embedding'ов в Milvus для поиска релевантных книг. Набор данных в этом примере взят из HuggingFace datasets и содержит чуть более 1 миллиона пар «название-описание». Начнем с загрузки необходимых библиотек для этого notebook: openai используется для связи с сервисом embedding'ов OpenAI pymilvus используется для связи с сервером Milvus datasets используется для загрузки набора данных tqdm используется для индикаторов прогресса После установки необходимых пакетов мы можем приступить к работе. Начнем с запуска сервиса Milvus. Запускаемый файл — это docker-compose.yaml, находящийся в той же папке, что и этот файл. Эта команда запускает автономный экземпляр Milvus, который мы будем использовать для этого теста. Когда Milvus запущен, мы можем настроить наши глобальные переменные: HOST: Адрес хоста Milvus PORT: Номер порта Milvus COLLECTION_NAME: Имя коллекции в Milvus DIMENSION: Размерность embedding'ов OPENAI_ENGINE: Какую модель embedding'ов использовать openai.api_key: Ваш ключ учетной записи OpenAI INDEX_PARAM: Настройки индекса для коллекции QUERY_PARAM: Параметры поиска для использования BATCH_SIZE: Сколько текстов embedding'ов вставлять за один batch Этот сегмент посвящен Milvus и настройке базы данных для данного сценария использования. В Milvus нам необходимо настроить коллекцию и проиндексировать ее. Когда Milvus запущен и работает, мы можем начать получать наши данные. Hugging Face Datasets — это хаб, содержащий множество различных пользовательских наборов данных, и для этого примера мы используем набор данных книг Skelebor. Этот набор данных содержит пары «название-описание» для более чем 1 миллиона книг. Мы собираемся создать embedding для каждого описания и сохранить его в Milvus вместе с названием. Теперь, когда данные находятся на нашей машине, мы можем начать создавать для них embedding'и и вставлять их в Milvus. Функция embedding'а принимает текст и возвращает embedding'и в формате списка. Следующий шаг — вставка данных.

План урока

  1. Поиск вашей следующей книги
  2. Milvus
  3. Dataset
  4. Вставка данных
  5. Запрос к базе данных

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды