Парсинг корпоративных документов и PDF

Урок 41 из 114 курса «Cohere: LLM University»: официальный курс Cohere LLM University (Кохир) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Основой технологии обработки естественного языка является текст. Как только мы можем свести набор данных к тексту, мы можем делать с ним всевозможные вещи: отвечать на вопросы, резюмировать, классифицировать, анализировать настроения, искать и индексировать, и многое другое. В контексте корпоративной генерации с дополненным извлечением (RAG) информация часто заблокирована в сложных типах файлов, таких как PDF. Эти форматы созданы для обмена информацией между людьми, но не так уж сильно подходят для языковых моделей. В этом блокноте мы будем использовать реальную фармацевтическую этикетку лекарства, чтобы протестировать различные эффективные подходы к парсингу PDF-файлов. Это позволит нам использовать модель Command-A от Cohere в настройке RAG для ответов на вопросы и запросы об этой этикетке, например: "Мне нужно краткое резюме названия соединения, показания, способа введения и механизма действия" данного фармацевтического препарата. Мы рассмотрим пять проприетарных, а также открытых вариантов для обработки PDF-файлов. Механизмы парсинга, продемонстрированные в следующих разделах, это: Google Document AI AWS Textract Unstructured.io LlamaParse pdf2image + pytesseract В качестве примера мы будем парсить 21-страничный PDF-файл, содержащий этикетку недавно одобренного FDA препарата, начало которого показано ниже. Затем мы выполним серию базовых задач RAG с нашими различными парсингами и оценим их производительность. Прежде чем мы углубимся в технические детали, нам нужно настроить среду выполнения и файловую систему блокнота. Приведенные ниже ячейки кода делают следующее: Устанавливают необходимые библиотеки Подтверждают, что зависимости данных из репозитория GitHub были загружены. Они будут находиться в data/document-parsing и содержать следующее: PDF-документ, с которым мы будем работать, fda-approved-drug.pdf (его также можно найти здесь: https://www.accessdata.fda.gov/drugsatfda_docs/label/2023/215500s000lbl.pdf) предварительно обработанные документы для каждого решения для парсинга. Хотя цель этого блокнота — проиллюстрировать, как это делается, мы предоставляем обработанные окончательные результаты, чтобы читатели могли перейти к разделу RAG, не настраивая необходимую инфраструктуру для каждого решения.

План урока

  1. Введение
  2. Парсинг PDF
  3. Настройка
  4. Вспомогательные функции
  5. Решения для парсинга документов
  6. Решение 1: Google Cloud Document AI [Вернуться к решениям]
  7. Парсинг документа
  8. Визуализация разобранного документа

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды