Кросс-модальный поиск с Haystack

Урок 47 из 80 курса «Gemini API: примеры использования»: официальный курс Gemini API Cookbook (Гугл Джемини) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Примечание: Для корректной работы этого notebook требуются лимиты скорости платного уровня. (см. цены для получения дополнительной информации). Gemini Embedding 2 — это мультимодальная модель embedding, которая отображает текст, изображения, видео, аудио и PDF-файлы в единое унифицированное пространство embedding. Haystack — это фреймворк оркестрации ИИ с открытым исходным кодом для создания контекстно-ориентированных, готовых к производству LLM-приложений. Вы можете использовать его для создания Agents, RAG, мультимодальных приложений, семантического поиска и многого другого. В этом notebook вы увидите несколько способов использования Gemini Embedding 2 с Haystack, начиная с текстового поиска и RAG, и расширяя до нескольких кросс-модальных примеров, где вы используете одну модальность для поиска по другим. Вы можете узнать больше об этой интеграции в блоге о запуске. Есть классный пример Gemini? Не стесняйтесь поделиться им! Сначала установите пакеты и настройте свой API key. Установите библиотеку Python Haystack, haystack-ai, пакет интеграции Haystack для Gemini API, google-genai-haystack, и другие библиотеки, необходимые для запуска примеров. Для запуска следующей cell ваш API key должен быть сохранен в Colab Secret с именем GEMINI_API_KEY. Если у вас еще нет API key или вы не знаете, как создать Colab Secret, см. Аутентификация для примера. В этом первом примере вы будете создавать embedding для коллекции документов о Семи чудесах Древнего мира, а затем выполнять поиск по ней, используя семантическое сходство. Вы используете: GoogleGenAIDocumentEmbedder для создания embedding документов, содержащих текст GoogleGenAITextEmbedder для создания embedding запроса (текстовой строки) Создайте документы, начиная с dataset, хранящегося на Hugging Face, создайте их embedding с помощью GoogleGenAIDocumentEmbedder, а затем сохраните их в InMemoryDocumentStore. InMemoryDocumentStore — это самый простой DocumentStore для начала работы, но он не рекомендуется для production. Чтобы узнать больше о различных типах внешних баз данных, которые поддерживает Haystack, см. DocumentStore Integrations. Теперь вы можете создать embedding для запроса и использовать InMemoryEmbeddingRetriever для поиска похожих документов.

План урока

  1. Обзор
  2. Этот notebook был предоставлен Stefano Fiorucci и Bilge Yücel.
  3. Настройка
  4. Установка
  5. Настройте свой API key
  6. Текстовый поиск
  7. Создание, embedding и хранение документов
  8. Поиск документов

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды