Анализ финансовых документов с LlamaIndex

Урок 247 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В этом примере notebook мы демонстрируем, как выполнить финансовый анализ документов 10-K с помощью фреймворка LlamaIndex, используя всего несколько строк кода. Введение Настройка и индексирование данных Простой QA Расширенный QA – Сравнение и сопоставление LlamaIndex — это фреймворк данных для LLM-приложений. Вы можете начать работу всего с нескольких строк кода и за считанные минуты создать систему retrieval-augmented generation (RAG). Для более опытных пользователей LlamaIndex предлагает богатый набор инструментов для приёма и индексирования данных, модули для retrieval и re-ranking, а также компонуемые компоненты для создания пользовательских query engine. Подробную информацию смотрите в полной документации. Ключевая часть работы финансового аналитика — извлечение информации и формирование выводов из объёмных финансовых документов. Отличным примером является форма 10-K — годовой отчёт, требуемый Комиссией по ценным бумагам и биржам США (SEC), который представляет собой всеобъемлющее резюме финансовой деятельности компании. Эти документы обычно насчитывают сотни страниц и содержат специфическую для предметной области терминологию, что затрудняет их быстрое понимание неподготовленным человеком. Мы демонстрируем, как LlamaIndex может помочь финансовому аналитику быстро извлекать информацию и формировать выводы из нескольких документов с минимальным объёмом кодирования. Для начала нам необходимо установить библиотеку llama-index Теперь импортируем все модули, используемые в этом руководстве Прежде чем начать, мы можем настроить LLM-провайдера и модель, которые будут лежать в основе нашей RAG-системы.Здесь мы выбираем gpt-3.5-turbo-instruct от OpenAI. Мы создаём ServiceContext и устанавливаем его в качестве глобального значения по умолчанию, чтобы все последующие операции, зависящие от вызовов LLM, использовали настроенную нами модель. Теперь мы загружаем и разбираем 2 PDF-файла (один для Uber 10-K за 2021 год и один для Lyft 10-K за 2021 год).Внутри PDF-файлы преобразуются в текстовые объекты Document, разделённые по страницам. Примечание: эта операция может занять некоторое время, так как каждый документ содержит более 100 страниц. Теперь мы можем построить (в оперативной памяти) VectorStoreIndex по загруженным нами документам.

План урока

  1. План Notebook
  2. Введение
  3. LLamaIndex
  4. Финансовый анализ документов 10-K
  5. Настройка
  6. Загрузка и индексирование данных
  7. Простой QA
  8. Расширенный QA – Сравнение и сопоставление

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды