Mistral AI в Haystack: чат по веб-страницам

Урок 92 из 148 курса «Mistral AI Cookbook»: официальный курс Mistral AI Cookbook (Мистраль) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В этом руководстве мы будем использовать Mistral embeddings и генеративные модели в двух Haystack pipeline: Мы создадим indexing pipeline, который сможет создавать embeddings для содержимого URL-адресов и индексировать их в векторную базу данных Мы создадим retrieval-augmented chat pipeline для чата с содержимым URL-адресов Сначала установим необходимые зависимости Далее нам нужно установить переменную среды MISTRAL_API_KEY 👇 Ниже мы используем mistral-embed в полноценном Haystack indexing pipeline. Мы создаем embeddings для содержимого выбранных URL-адресов с помощью mistral-embed и записываем их в InMemoryDocumentStore с помощью MistralDocumentEmbedder. 💡Это хранилище документов является самым простым для начала работы, так как не требует настройки. Вы можете свободно изменить это хранилище документов на любую из векторных баз данных, доступных для Haystack 2.0, таких как Weaviate, Chroma, AstraDB и т.д. Теперь, когда мы проиндексировали содержимое и embeddings различных URL-адресов, мы можем создать RAG pipeline, который использует компонент MistralChatGenerator с mistral-small. Еще несколько моментов, которые стоит знать об этом pipeline: Мы используем MistralTextEmbedder для создания embedding нашего вопроса и извлечения 1 наиболее релевантного документа Мы включаем streaming-ответы, предоставляя streaming_callback documents предоставляется в chat template ретривером, в то время как мы предоставляем query pipeline при его запуске.

План урока

  1. Индексирование URL-адресов с помощью Mistral Embeddings
  2. Чат с URL-адресами с помощью генеративных моделей Mistral

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды