Поиск по эмбеддингам в Typesense

Урок 287 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Этот notebook проведет вас через простой процесс загрузки данных, их embedding, а затем индексации и поиска с использованием различных векторных баз данных. Это распространенное требование для клиентов, желающих хранить и искать наши embeddings со своими собственными данными в безопасной среде для поддержки производственных сценариев использования, таких как чат-боты, тематическое моделирование и многое другое. Векторная база данных — это база данных, предназначенная для хранения, управления и поиска векторов embedding. Использование embeddings для кодирования неструктурированных данных (текст, аудио, видео и прочее) в виде векторов для потребления моделями машинного обучения резко возросло в последние годы благодаря растущей эффективности ИИ в решении сценариев использования, связанных с естественным языком, распознаванием изображений и другими неструктурированными формами данных. Векторные базы данных стали эффективным решением для предприятий по реализации и масштабированию этих сценариев использования. Векторные базы данных позволяют предприятиям использовать многие сценарии применения embeddings, которыми мы поделились в этом repo (например, ответы на вопросы, чат-боты и рекомендательные сервисы), и применять их в безопасной, масштабируемой среде. Многие наши клиенты используют embeddings для решения своих задач в небольших масштабах, но производительность и безопасность мешают им внедрять решения в production — мы рассматриваем векторные базы данных как ключевой компонент в решении этой проблемы, и в этом руководстве мы рассмотрим основы embedding текстовых данных, их хранения в векторной базе данных и использования для семантического поиска. Порядок демонстрации следующий: Настройка: Импортируйте пакеты и установите все необходимые переменные данных: Загрузите набор данных и выполните его embedding с использованием OpenAI embeddings Typesense Настройка: Настройте Python-клиент Typesense. Для получения дополнительной информации перейдите сюда Индексация данных: Мы создадим коллекцию и проиндексируем ее как для заголовков, так и для содержимого. Поиск данных: Выполните несколько примеров запросов с различными целями.

План урока

  1. Что такое векторная база данных
  2. Зачем использовать векторную базу данных
  3. Порядок демонстрации
  4. Настройка
  5. Загрузка данных
  6. Typesense
  7. Индексация данных
  8. Поиск данных

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды