О чём урок
Этот notebook демонстрирует, как использовать GPT-4o для преобразования многоформатных PDF-документов, таких как презентации или экспорты с веб-страниц, в пригодный для использования контент для вашего RAG-приложения. Эту технику можно использовать, если у вас есть много неструктурированных данных, содержащих ценную информацию, которую вы хотите иметь возможность извлекать в рамках вашего RAG-пайплайна. Например, вы могли бы создать Ассистента знаний, который мог бы отвечать на запросы пользователей о вашей компании или продукте на основе информации, содержащейся в PDF-документах. Примерные документы, используемые в этом notebook, находятся по адресу data/example_pdfs. Они связаны с API OpenAI и различными техниками, которые можно использовать в рамках LLM-проектов. В этом разделе мы обработаем наши входные данные, чтобы подготовить их к извлечению. Мы сделаем это двумя способами: Извлечение текста с помощью pdfminer Преобразование PDF-страниц в изображения для анализа с помощью GPT-4o Вы можете пропустить первый метод, если хотите использовать только контент, полученный в результате анализа изображений. Нам нужно установить несколько библиотек для преобразования PDF в изображения и извлечения текста (опционально). Примечание: Вам необходимо установить poppler на вашей машине, чтобы библиотека pdf2image работала. Вы можете следовать инструкциям по установке здесь.
План урока
- Подготовка данных
- Настройка
- Обработка файлов
- Тестирование на примере
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.