Поиск по документам с эмбеддингами: второй вариант

Урок 44 из 80 курса «Gemini API: примеры использования»: официальный курс Gemini API Cookbook (Гугл Джемини) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Примечание: Для корректной работы этого notebook требуются лимиты скорости платного уровня (paid tier rate limits). (См. цены для получения более подробной информации). Этот пример демонстрирует, как использовать Gemini API для создания embeddings, чтобы вы могли выполнять поиск документов (document search). Вы будете использовать клиентскую библиотеку Python для создания word embedding, которая позволит вам сравнивать поисковые запросы (search strings) или вопросы с содержимым документов. В этом tutorial вы будете использовать embeddings для выполнения поиска документов по набору документов, чтобы задавать вопросы, связанные с Google Car. Вы можете запустить этот quickstart в Google Colab. Чтобы выполнить этот quickstart в вашей собственной среде разработки (development environment), убедитесь, что ваша среда соответствует следующим требованиям: Python 3.11+ Установленный jupyter для запуска notebook. Сначала загрузите и установите библиотеку Python для Gemini API. Прежде чем вы сможете использовать Gemini API, вы должны сначала получить API key. Если у вас его еще нет, создайте ключ одним щелчком мыши в Google AI Studio. Получить API key В Colab добавьте ключ в secrets manager под значком "🔑" на левой панели. Присвойте ему имя GEMINI_API_KEY. После получения API key передайте его в SDK. Вы можете сделать это двумя способами: Поместите ключ в переменную среды GEMINI_API_KEY (SDK автоматически подхватит его оттуда). Передайте ключ в genai.Client(api_key=...) Ключевой момент: Далее вы выберете model. Любая embedding model подойдет для этого tutorial, но для реальных applications важно выбрать конкретную model и придерживаться ее. Выходы (outputs) разных models несовместимы друг с другом. В этом разделе вы увидите, как генерировать embeddings для различных текстов в dataframe, используя embeddings из Gemini API. Gemini embedding model поддерживает несколько task types, каждый из которых адаптирован для конкретной цели. Ниже представлен общий обзор доступных типов и их applications: Task Type Описание RETRIEVAL_QUERY Указывает, что данный текст является query в контексте поиска/извлечения информации.

План урока

  1. Обзор
  2. Предварительные требования
  3. Настройка
  4. Получение API Key
  5. Выбор используемой model
  6. Генерация embeddings
  7. Создание базы данных embeddings
  8. Поиск документов с помощью Q&A

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды