О чём урок
Это руководство поможет вам настроить и использовать инструмент Парсер структурированных документов для извлечения текста, таблиц и изображений из PDF-документов. Отредактируйте файл src/config.yaml для настройки инструмента: Это приведет к следующему: Преобразовать каждую страницу PDF в изображение Выполнить LLM inference для извлечения текста Сохранить извлеченный текст в формате JSON в директории extracted Таблицы будут сохранены как отдельные CSV-файлы в директории extracted/tables_TIMESTAMP/. Таблицы будут объединены в один файл Excel с несколькими листами. Извлеченный контент будет храниться в базе данных SQLite для структурированных запросов. Отредактируйте prompt'ы в файле src/config.yaml, чтобы улучшить извлечение для ваших конкретных типов документов: Добавьте конфигурацию в файл src/config.yaml: Обновите CLI в файле src/structured_extraction.py: Если ответы LLM не парсятся корректно, проверьте следующее: Вашу выходную схему в файле config.yaml Настройку use_json_decoding (установите значение true для более надежного парсинга) Рассмотрите возможность использования более крупной модели или уменьшения сложности извлечения Если вы столкнулись с ошибками базы данных: Убедитесь, что SQLite установлен корректно Проверьте разрешения файла базы данных Используйте DatabaseManager.create_artifact_table() для повторной инициализации схемы таблицы Если качество извлечения из PDF низкое: Попробуйте настроить параметр DPI в PDFUtils.extract_pages() Для сложных макетов разделите извлечение на более мелкие части (по секциям) Рассмотрите возможность предварительной обработки PDF-файлов с помощью инструментов OCR для улучшения качества текстового слоя Попробуйте извлекать данные из различных типов документов Настройте prompt'ы и схемы для ваших конкретных сценариев использования Изучите возможности векторного поиска для семантических запросов к документам Интегрируйте с вашими существующими рабочими процессами обработки документов
План урока
- Настройка
- 1. Установка зависимостей
- 2. Настройка инструмента
- Примеры базового использования
- Извлечение текста из PDF
- Извлечение текста и таблиц
- Извлечение всех типов контента
- Обработка нескольких PDF-файлов
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.