О чём урок
В этом примере notebook мы демонстрируем, как выполнить финансовый анализ документов 10-K с помощью фреймворка LlamaIndex, используя всего несколько строк кода. Введение Настройка и индексирование данных Простой QA Расширенный QA – Сравнение и сопоставление LlamaIndex — это фреймворк данных для LLM-приложений. Вы можете начать работу всего с нескольких строк кода и за считанные минуты создать систему retrieval-augmented generation (RAG). Для более опытных пользователей LlamaIndex предлагает богатый набор инструментов для приёма и индексирования данных, модули для retrieval и re-ranking, а также компонуемые компоненты для создания пользовательских query engine. Подробную информацию смотрите в полной документации. Ключевая часть работы финансового аналитика — извлечение информации и формирование выводов из объёмных финансовых документов. Отличным примером является форма 10-K — годовой отчёт, требуемый Комиссией по ценным бумагам и биржам США (SEC), который представляет собой всеобъемлющее резюме финансовой деятельности компании. Эти документы обычно насчитывают сотни страниц и содержат специфическую для предметной области терминологию, что затрудняет их быстрое понимание неподготовленным человеком. Мы демонстрируем, как LlamaIndex может помочь финансовому аналитику быстро извлекать информацию и формировать выводы из нескольких документов с минимальным объёмом кодирования. Для начала нам необходимо установить библиотеку llama-index Теперь импортируем все модули, используемые в этом руководстве Прежде чем начать, мы можем настроить LLM-провайдера и модель, которые будут лежать в основе нашей RAG-системы.Здесь мы выбираем gpt-3.5-turbo-instruct от OpenAI. Мы создаём ServiceContext и устанавливаем его в качестве глобального значения по умолчанию, чтобы все последующие операции, зависящие от вызовов LLM, использовали настроенную нами модель. Теперь мы загружаем и разбираем 2 PDF-файла (один для Uber 10-K за 2021 год и один для Lyft 10-K за 2021 год).Внутри PDF-файлы преобразуются в текстовые объекты Document, разделённые по страницам. Примечание: эта операция может занять некоторое время, так как каждый документ содержит более 100 страниц. Теперь мы можем построить (в оперативной памяти) VectorStoreIndex по загруженным нами документам.
План урока
- План Notebook
- Введение
- LLamaIndex
- Финансовый анализ документов 10-K
- Настройка
- Загрузка и индексирование данных
- Простой QA
- Расширенный QA – Сравнение и сопоставление
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.