Выжимаем максимум из GPT-5.4 в работе с документами

Урок 209 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

GPT-5.4 является значительным шагом вперед для реальных мультимодальных рабочих нагрузок. Документы, которые ранее создавали нагрузку на системы компьютерного зрения или требовали объединения OCR, обнаружения макета и пользовательских парсеров, включая плотные сканы, рукописные формы, инженерные схемы и отчеты с большим количеством графиков, теперь часто могут быть интерпретированы и проанализированы за один проход model с помощью GPT-5.4. Однако конфигурация model является ключом к достижению SOTA результатов. Небольшие изменения в детализации изображения, детализации вывода (verbosity), усилиях по рассуждению (reasoning effort) и использовании инструментов могут значительно повлиять на производительность. Этот notebook сфокусирован на наиболее эффективных настройках для рабочих нагрузок с документами: детализация изображения, детализация вывода (verbosity), усилия по рассуждению (reasoning effort) и использование инструментов. Цель состоит в том, чтобы показать, когда каждый из этих параметров важен, как он изменяет output и как выбрать конфигурацию, которая будет одновременно надежной и практичной. Все примеры в этом notebook используют Responses API через client.responses.create(...). «Настройки», о которых мы говорим, — это параметры запроса, которые вы передаете в этот вызов. input: список объектов, похожих на сообщения (обычно один { "role": "user", "content": [...] }) content: список типизированных блоков, обычно: { "type": "input_text", "text": "..." } { "type": "input_image", "image_url": "...", "detail": "auto" | "original" } Детализация изображения (input_image.detail): управляет разрешением изображения, используемым для компьютерного зрения. Используйте "auto" для большинства страниц; используйте "original", когда текст мелкий, рукописный или скан низкого качества. Детализация вывода (Verbosity) (text={"verbosity": ...}): влияет на то, насколько сжатым или буквальным будет текстовый output. Более высокая детализация вывода (verbosity) полезна для точной транскрипции. Усилия по рассуждению (Reasoning effort) (reasoning={"effort": ...}): выделяет больше вычислительных ресурсов для многошагового визуального рассуждения (графики, таблицы, диаграммы), когда изображение уже читаемо. Использование инструментов (tools=[...] + instructions=...): опционально позволяет model использовать такие инструменты, как Code Interpreter, для масштабирования/обрезки/инспектирования перед ответом; опускайте инструменты, когда достаточно однопроходного ответа.

План урока

  1. Формат входных данных
  2. Параметры, используемые в этом notebook
  3. Формат выходных данных
  4. Краткое руководство по принятию решений
  5. Настройка
  6. 1. Увеличение детализации изображения для плотных страниц и рукописного текста

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды