RAG по изображениям через Vision и Responses API

Урок 214 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Добро пожаловать! Этот notebook демонстрирует, как создать систему генерации с дополненной выборкой (RAG) с использованием Vision и Responses API от OpenAI. Он фокусируется на мультимодальных данных, объединяя изображения и текстовые входные данные для анализа клиентского опыта. Система использует GPT-5 и интегрирует понимание изображений с поиском по файлам для предоставления контекстно-зависимых ответов. Мультимодальные наборы данных становятся всё более распространёнными, особенно в таких областях, как здравоохранение, где записи часто содержат как визуальные данные (например, радиологические снимки), так и сопроводительный текст (например, клинические заметки). Реальные наборы данных также, как правило, зашумлены, содержат неполную или отсутствующую информацию, что делает критически важным анализ нескольких модальностей в тандеме. Это руководство посвящено сценарию использования в сфере обслуживания клиентов: оценке отзывов клиентов, которые могут включать фотографии и письменные обзоры. Вы узнаете, как синтетически генерировать как изображения, так и текстовые входные данные, использовать поиск по файлам для извлечения контекста и применять Evals API для оценки того, как включение понимания изображений влияет на общую производительность. Настройка и зависимости Примеры генераций Обработка данных синтетических наборов данных Объединение данных Заполнение векторного хранилища данных для поиска по файлам Настройка фильтров атрибутов Извлечение и фильтрация Тестирование производительности извлечения Применение фильтров на основе атрибутов Оценка и анализ Сравнение предсказаний с эталонными данными Анализ метрик производительности Генерация высококачественных данных для обучения и оценки в задачах машинного обучения может быть дорогостоящей и трудоёмкой. Синтетические данные предлагают практичную и масштабируемую альтернативу. В этом notebook Image API от OpenAI используется для генерации синтетических изображений, а Responses API — для создания синтетического текста, что обеспечивает эффективное прототипирование и экспериментирование в мультимодальных задачах. В этом примере мы будем работать с предварительно сгенерированным синтетическим набором данных отзывов клиентов, который включает короткие текстовые фрагменты, изображения из отзывов клиентов и иногда комбинированные мультимодальные записи.

План урока

  1. Обзор
  2. Оглавление
  3. Настройка и зависимости
  4. Примеры генераций
  5. Обработка данных

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды