О чём урок
Основой технологии обработки естественного языка является текст. Как только мы можем свести набор данных к тексту, мы можем делать с ним всевозможные вещи: отвечать на вопросы, резюмировать, классифицировать, анализировать настроения, искать и индексировать, и многое другое. В контексте корпоративной генерации с дополненным извлечением (RAG) информация часто заблокирована в сложных типах файлов, таких как PDF. Эти форматы созданы для обмена информацией между людьми, но не так уж сильно подходят для языковых моделей. В этом блокноте мы будем использовать реальную фармацевтическую этикетку лекарства, чтобы протестировать различные эффективные подходы к парсингу PDF-файлов. Это позволит нам использовать модель Command-A от Cohere в настройке RAG для ответов на вопросы и запросы об этой этикетке, например: "Мне нужно краткое резюме названия соединения, показания, способа введения и механизма действия" данного фармацевтического препарата. Мы рассмотрим пять проприетарных, а также открытых вариантов для обработки PDF-файлов. Механизмы парсинга, продемонстрированные в следующих разделах, это: Google Document AI AWS Textract Unstructured.io LlamaParse pdf2image + pytesseract В качестве примера мы будем парсить 21-страничный PDF-файл, содержащий этикетку недавно одобренного FDA препарата, начало которого показано ниже. Затем мы выполним серию базовых задач RAG с нашими различными парсингами и оценим их производительность. Прежде чем мы углубимся в технические детали, нам нужно настроить среду выполнения и файловую систему блокнота. Приведенные ниже ячейки кода делают следующее: Устанавливают необходимые библиотеки Подтверждают, что зависимости данных из репозитория GitHub были загружены. Они будут находиться в data/document-parsing и содержать следующее: PDF-документ, с которым мы будем работать, fda-approved-drug.pdf (его также можно найти здесь: https://www.accessdata.fda.gov/drugsatfda_docs/label/2023/215500s000lbl.pdf) предварительно обработанные документы для каждого решения для парсинга. Хотя цель этого блокнота — проиллюстрировать, как это делается, мы предоставляем обработанные окончательные результаты, чтобы читатели могли перейти к разделу RAG, не настраивая необходимую инфраструктуру для каждого решения.
План урока
- Введение
- Парсинг PDF
- Настройка
- Вспомогательные функции
- Решения для парсинга документов
- Решение 1: Google Cloud Document AI [Вернуться к решениям]
- Парсинг документа
- Визуализация разобранного документа
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.