Парсер структурированных документов: первые шаги

Урок 30 из 32 курса «Llama: сценарии использования»: официальный курс Llama Cookbook (Мета Лама) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Это руководство поможет вам настроить и использовать инструмент Парсер структурированных документов для извлечения текста, таблиц и изображений из PDF-документов. Отредактируйте файл src/config.yaml для настройки инструмента: Это приведет к следующему: Преобразовать каждую страницу PDF в изображение Выполнить LLM inference для извлечения текста Сохранить извлеченный текст в формате JSON в директории extracted Таблицы будут сохранены как отдельные CSV-файлы в директории extracted/tables_TIMESTAMP/. Таблицы будут объединены в один файл Excel с несколькими листами. Извлеченный контент будет храниться в базе данных SQLite для структурированных запросов. Отредактируйте prompt'ы в файле src/config.yaml, чтобы улучшить извлечение для ваших конкретных типов документов: Добавьте конфигурацию в файл src/config.yaml: Обновите CLI в файле src/structured_extraction.py: Если ответы LLM не парсятся корректно, проверьте следующее: Вашу выходную схему в файле config.yaml Настройку use_json_decoding (установите значение true для более надежного парсинга) Рассмотрите возможность использования более крупной модели или уменьшения сложности извлечения Если вы столкнулись с ошибками базы данных: Убедитесь, что SQLite установлен корректно Проверьте разрешения файла базы данных Используйте DatabaseManager.create_artifact_table() для повторной инициализации схемы таблицы Если качество извлечения из PDF низкое: Попробуйте настроить параметр DPI в PDFUtils.extract_pages() Для сложных макетов разделите извлечение на более мелкие части (по секциям) Рассмотрите возможность предварительной обработки PDF-файлов с помощью инструментов OCR для улучшения качества текстового слоя Попробуйте извлекать данные из различных типов документов Настройте prompt'ы и схемы для ваших конкретных сценариев использования Изучите возможности векторного поиска для семантических запросов к документам Интегрируйте с вашими существующими рабочими процессами обработки документов

План урока

  1. Настройка
  2. 1. Установка зависимостей
  3. 2. Настройка инструмента
  4. Примеры базового использования
  5. Извлечение текста из PDF
  6. Извлечение текста и таблиц
  7. Извлечение всех типов контента
  8. Обработка нескольких PDF-файлов

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды