RAG на MongoDB и Mistral AI

Урок 118 из 148 курса «Mistral AI Cookbook»: официальный курс Mistral AI Cookbook (Мистраль) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Создание LLM GenAI приложения объединяет мощь Mistral AI с надёжностью векторного хранилища корпоративного уровня, такого как MongoDB. Ниже представлено подробное пошаговое руководство по внедрению этой инновационной системы: Установите MISTRAL_API_KEY и настройте подписку для её активации. Получите MONGO_URI из кластера MongoDB Atlas. В этом разделе показаны версии необходимых библиотек. Лично я запускаю свой код в VScode. Поэтому вам необходимо предварительно установить следующие библиотеки. Вот версии на момент запуска следующего кода. mistralai 0.0.8 pymongo 4.3.3 gradio 4.10.0 gradio_client 0.7.3 langchain 0.0.348 langchain-core 0.0.12 pandas 2.0.3 Они включают библиотеки для обработки данных, веб-скрейпинга, моделей ИИ и взаимодействия с базами данных. Вы можете использовать свои API keys, экспортированные из командной оболочки. Функция data_prep() загружает данные из PDF, документа или указанного URL. Она извлекает текстовое содержимое из веб-страницы/документации, удаляет нежелательные элементы, а затем разбивает данные на управляемые фрагменты (chunks). После того как данные разбиты на фрагменты (chunked), мы используем embedding endpoint Mistral AI для вычисления embeddings для каждого фрагмента и сохранения их в документе. Затем каждый документ добавляется в коллекцию MongoDB. Функция connect_mongodb() устанавливает соединение с сервером MongoDB. Она возвращает объект коллекции, который можно использовать для взаимодействия с базой данных. Эта функция будет вызвана в функции data_prep(). Чтобы получить строку подключения к MongoDB, вы можете перейти в консоль MongoDB Atlas, нажать кнопку «Connect» на вашем кластере и выбрать драйвер Python. Функция get_embedding(text) генерирует embedding для заданного текста. Она заменяет символы новой строки, а затем использует Studio embedding endpoints для получения embedding. Эта функция будет вызвана как в процессе подготовки данных, так и в процессе вопросов и ответов. Чтобы выполнить запрос векторного поиска, вам нужно только создать индекс векторного поиска в MongoDB Atlas следующим образом.

План урока

  1. Импорт необходимых библиотек
  2. Подготовка данных
  3. Подключение к серверу MongoDB
  4. Получение embeddings
  5. Последняя конфигурация для индекса векторного поиска MongoDB
  6. Поиск похожих документов
  7. Функция вопросов и ответов

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды