LLM-агент для поиска статей на arXiv

Урок 104 из 148 курса «Mistral AI Cookbook»: официальный курс Mistral AI Cookbook (Мистраль) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Этот notebook был создан Андреем Черновым (Github, Linkedin) В этом руководстве мы создадим LLM агента на основе языковой модели MistralAI. Основной целью агента будет поиск и обобщение научных статей с Arxiv, которые релевантны запросу пользователя. Для создания агента мы будем использовать фреймворк LlamaIndex. Агент будет использовать следующие три инструмента: RAG Query Engine Этот инструмент будет хранить и извлекать недавние статьи с Arxiv, служа базой знаний для эффективного и быстрого доступа к релевантной информации. Paper Fetch Tool Если пользователь укажет тему, которая не охвачена в RAG Query Engine, этот инструмент будет получать недавние статьи по указанной теме непосредственно с Arxiv. PDF Download Tool Этот инструмент позволяет агенту загружать PDF-файл научной статьи локально, используя ссылку, предоставленную Arxiv. Вы можете получить API key здесь. Для этого руководства мы будем использовать embedding модель MistralAI. Чтобы это руководство было доступно с бесплатной версией Mistral API, мы загрузим только последние 10 статей. большего количества превысит лимит при последующем создании RAG query engine. Однако, если у вас есть подписка Mistral, вы можете загрузить дополнительные статьи. Этот процесс создает векторное представление для каждого фрагмента документа, используя embedding модель. Индексирование большого количества текстов может быть трудоемким и дорогостоящим, поскольку это требует вызовов API к embedding модели. В реальных приложениях лучше хранить индекс в векторной базе данных, чтобы избежать повторного индексирования. Однако для простоты в этом руководстве мы будем хранить индекс локально в директории, не используя векторную базу данных. Хорошей практикой является предоставление осмысленного имени и четкого описания для каждого инструмента. Это помогает агенту выбрать наиболее подходящий инструмент при необходимости. Обратите внимание, что есть два prompt'а. По умолчанию LlamaIndex использует refine prompt перед возвратом ответа. Вы можете найти больше информации о режимах ответа здесь.

План урока

  1. Инструменты, используемые агентом
  2. Сначала установим необходимые библиотеки
  3. Дополнительно вам необходимо предоставить ваш API Key для доступа к моделям Mistral
  4. Для создания RAG Query Engine нам понадобится embedding модель
  5. Теперь мы загрузим недавние статьи о больших языковых моделях с ArXiv
  6. Для создания RAG агента сначала нам нужно проиндексировать все документы
  7. Теперь мы сохраним индекс
  8. Мы готовы создать RAG Query Engine для нашего агента

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды