Вытаскиваем данные из длинных документов

Урок 18 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

GPT-3 может помочь нам извлекать ключевые цифры, даты или другие важные фрагменты контента из документов, которые слишком велики, чтобы поместиться в контекстное окно. Один из подходов к решению этой проблемы заключается в разделении документа на чанки, обработке каждого чанка по отдельности, а затем объединении результатов в единый список ответов. В этом notebook мы рассмотрим следующий подход: Загрузить объемный PDF-файл и извлечь из него текст Создать prompt для извлечения ключевых фрагментов информации Разделить документ на чанки и обработать каждый чанк для извлечения ответов Объединить их в конце Затем этот простой подход будет расширен для решения трех более сложных вопросов Настройка: Взять PDF-файл, документ "Финансовые регламенты Формулы-1 по силовым установкам", и извлечь из него текст для entity extraction. Мы будем использовать это для попытки извлечь ответы, скрытые в контенте. Простое Entity Extraction: Извлечь ключевые фрагменты информации из чанков документа путем: Создания шаблонного prompt с нашими вопросами и примером ожидаемого формата Создания функции, которая принимает чанк текста в качестве входных данных, объединяет его с prompt и получает ответ Запуска скрипта для разделения текста на чанки, извлечения ответов и их вывода для парсинга Сложное Entity Extraction: Задать несколько более сложных вопросов, которые требуют более глубокого анализа для получения ответа Мы смогли безопасно извлечь первые два ответа, в то время как третий был затруднен из-за даты, появлявшейся на каждой странице, хотя правильный ответ также присутствует.

План урока

  1. Подход
  2. Настройка
  3. Простое Entity Extraction
  4. Сложное Entity Extraction
  5. Консолидация

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды