Первые шаги с Zilliz

Урок 294 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В этом notebook мы рассмотрим создание embeddings описаний книг с помощью OpenAI и использование этих embeddings в Zilliz для поиска релевантных книг. Набор данных в этом примере взят из HuggingFace datasets и содержит чуть более 1 миллиона пар "название-описание". Начнем с загрузки необходимых библиотек для этого notebook: openai используется для связи с сервисом OpenAI embedding pymilvus используется для связи с экземпляром Zilliz datasets используется для загрузки dataset tqdm используется для индикаторов прогресса Чтобы запустить Zilliz, ознакомьтесь с информацией здесь. После настройки учетной записи и базы данных установите следующие значения: URI: URI, на котором работает ваша база данных USER: Имя пользователя вашей базы данных PASSWORD: Пароль вашей базы данных COLLECTION_NAME: Имя коллекции в Zilliz DIMENSION: Размерность embeddings OPENAI_ENGINE: Какую модель embedding использовать openai.api_key: Ключ вашей учетной записи OpenAI INDEX_PARAM: Настройки индекса для коллекции QUERY_PARAM: Параметры поиска для использования BATCH_SIZE: Сколько текстов встраивать (embed) и вставлять за один раз Этот раздел посвящен Zilliz и настройке базы данных для данного сценария использования. В Zilliz нам необходимо создать коллекцию и проиндексировать ее. Когда Zilliz запущен и работает, мы можем начать получать наши данные. Hugging Face Datasets — это хаб, содержащий множество различных пользовательских datasets, и для этого примера мы используем book dataset от Skelebor. Этот dataset содержит пары "название-описание" для более чем 1 миллиона книг. Мы собираемся создать embedding для каждого описания и сохранить его в Zilliz вместе с названием. Теперь, когда данные находятся на нашей машине, мы можем начать создавать их embeddings и вставлять их в Zilliz. Функция embedding принимает текст и возвращает embeddings в формате списка. Этот следующий шаг выполняет фактическую вставку. Из-за большого количества datapoints, если вы хотите немедленно протестировать, вы можете остановить блок cell для вставки раньше и продолжить.

План урока

  1. Поиск вашей следующей книги
  2. Zilliz
  3. Набор данных
  4. Вставка данных
  5. Запрос к базе данных

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды