Дообучение GPT-4o отвечать на вопросы по картинкам

Урок 208 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Мы рады объявить о запуске Vision Fine-tuning на GPT-4o — передовой возможности мультимодального fine-tuning'а, которая позволяет разработчикам выполнять fine-tuning GPT-4o, используя как изображения, так и текст. Благодаря этой новой функции вы можете настраивать модели для улучшения возможностей понимания изображений, открывая новые перспективы в различных отраслях и приложениях. От расширенного визуального поиска до улучшенного обнаружения объектов для автономных транспортных средств или умных городов, vision fine-tuning позволяет создавать решения, адаптированные к вашим конкретным потребностям. Сочетая текстовые и графические входные данные, этот продукт уникально подходит для таких задач, как визуальные ответы на вопросы, где подробные, контекстно-зависимые ответы получаются путем анализа изображений. В целом, это кажется наиболее эффективным, когда модели предоставляются вопросы и изображения, похожие на обучающие данные, поскольку мы можем научить модель искать и идентифицировать соответствующие части изображения для правильного ответа на вопрос. Аналогично fine-tuning'у на текстовых входных данных, vision fine-tuning не так полезен для обучения модели новой информации. В этом руководстве мы расскажем вам, как выполнить fine-tuning GPT-4o с использованием мультимодальных входных данных. В частности, мы покажем, как обучить модель для ответов на вопросы, связанные с изображениями книг, но потенциальные области применения охватывают бесчисленное множество сфер — от веб-дизайна и образования до здравоохранения и исследований. Независимо от того, стремитесь ли вы создавать более интеллектуальные модели обнаружения дефектов для производства, улучшать обработку сложных документов и понимание диаграмм, или разрабатывать приложения с лучшим визуальным восприятием для множества других сценариев использования, это руководство покажет вам, как быстро и легко начать работу. Для получения дополнительной информации ознакомьтесь с полной Документацией. Мы будем работать с набором данных пар «вопрос-ответ» по изображениям книг из набора данных OCR-VQA, доступного через HuggingFace. Этот набор данных содержит 207 572 изображения книг с соответствующими парами «вопрос-ответ», запрашивающими информацию о названии, авторе, издании, годе и жанре книги. Всего набор данных содержит около 1 миллиона пар «вопрос-ответ».

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды