Разбираем PDF для RAG-приложений

Урок 46 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Этот notebook демонстрирует, как использовать GPT-4o для преобразования многоформатных PDF-документов, таких как презентации или экспорты с веб-страниц, в пригодный для использования контент для вашего RAG-приложения. Эту технику можно использовать, если у вас есть много неструктурированных данных, содержащих ценную информацию, которую вы хотите иметь возможность извлекать в рамках вашего RAG-пайплайна. Например, вы могли бы создать Ассистента знаний, который мог бы отвечать на запросы пользователей о вашей компании или продукте на основе информации, содержащейся в PDF-документах. Примерные документы, используемые в этом notebook, находятся по адресу data/example_pdfs. Они связаны с API OpenAI и различными техниками, которые можно использовать в рамках LLM-проектов. В этом разделе мы обработаем наши входные данные, чтобы подготовить их к извлечению. Мы сделаем это двумя способами: Извлечение текста с помощью pdfminer Преобразование PDF-страниц в изображения для анализа с помощью GPT-4o Вы можете пропустить первый метод, если хотите использовать только контент, полученный в результате анализа изображений. Нам нужно установить несколько библиотек для преобразования PDF в изображения и извлечения текста (опционально). Примечание: Вам необходимо установить poppler на вашей машине, чтобы библиотека pdf2image работала. Вы можете следовать инструкциям по установке здесь.

План урока

  1. Подготовка данных
  2. Настройка
  3. Обработка файлов
  4. Тестирование на примере

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды