Цели урока
- Объяснить, что такое генерация изображений и где она полезна.
- Понять семейство моделей gpt-image и чем оно отличается от устаревших моделей DALL·E.
- Создать приложение для генерации изображений на Python (а также TypeScript / .NET).
- Редактировать изображения и применять защитные метапромпты.
О чём урок
Примечание AI University. Примеры кода в оригинале курса рассчитаны на Azure OpenAI или GitHub Models. Те же запросы можно отправлять через OpenAI API или другой OpenAI-совместимый сервис: замените клиент, адрес сервиса, название модели и ключ на свои и сверьтесь с документацией выбранного провайдера. Возможности больших языковых моделей (LLM) выходят за рамки генерации текста. Вы также можете генерировать изображения по текстовым описаниям. Изображения как модальность полезны в MedTech, архитектуре, туризме, разработке игр, маркетинге и других областях. В этом уроке мы рассмотрим современные модели GPT Image и создадим приложение для генерации изображений. Генерация изображений позволяет превращать промпт на естественном языке в картинку. В этом уроке мы работаем с семейством моделей gpt-image от OpenAI, текущим поколением моделей для изображений, доступных на Microsoft Foundry и платформе OpenAI. Эти модели заменяют старые модели DALL·E (DALL·E 2/3 являются устаревшими). На протяжении урока мы используем вымышленный стартап Edu4All, который создаёт обучающие инструменты. Команда хочет генерировать иллюстрации для заданий и учебных материалов. Модели генерации изображений создают изображения по текстовому промпту. Современные модели, такие как gpt-image, построены на основе трансформеров и диффузионных техник: модель изучает связь между текстом и изображениями во время обучения, затем, получив промпт, итеративно «очищает» случайный шум, превращая его в изображение, соответствующее описанию. Два хорошо известных семейства моделей изображений: gpt-image (OpenAI): текущее поколение, используемое в этом уроке. Поддерживает генерацию текста в изображение и редактирование изображений (inpainting с маской). Midjourney: популярная сторонняя модель с собственным сервисом и рабочим процессом на основе Discord. Старые модели изображений OpenAI, DALL·E 2 и DALL·E 3, являются устаревшими. DALL·E 3 больше не доступен для новых развёртываний, а такие функции, как create_variation, существовали только в DALL·E 2. Для новых приложений используйте модели gpt-image.
План урока
- Введение
- Что такое генерация изображений?
- Какую модель gpt-image мне использовать?
- Настройка
- 1. Создайте и разверните модель
- 2. Настройте ваш .env
- 3. Установите библиотеки
- Создайте приложение
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.