О чём урок
Модели Imagen — это высококачественные модели Google для преобразования текста в изображение, обладающие рядом новых и улучшенных возможностей. Модели Imagen могут выполнять следующее: Генерировать изображения с высокой детализацией, насыщенным освещением и минимальным количеством отвлекающих артефактов Понимать prompt'ы, написанные на естественном языке Генерировать изображения в широком диапазоне форматов и стилей Эффективно отображать текст Вы можете выбрать из ряда доступных моделей Imagen: Imagen 4 (imagen-4.0-generate-001) — это новая стандартная модель, которую следует использовать для генерации. Imagen 4 Ultra (imagen-4.0-ultra-generate-001) — лучшая модель Imagen, генерирующая ещё более детализированные изображения и особенно хорошо справляющаяся с генерацией изображений с текстом. Обратите внимание, что она может генерировать только одно изображение за раз. Imagen 4 Fast (imagen-4.0-fast-generate-001) — это более быстрая модель, генерирующая изображения с меньшими затратами по сравнению с Imagen 4 и Ultra. Подробности см. на странице цен. Imagen 3 (imagen-3.0-generate-002) — это модель предыдущего поколения. Она всё ещё доступна, если вам нужно повторно запустить старые prompt'ы, но теперь рекомендуется использовать модели 4-го поколения. Этот notebook использует REST API. Для Python SDK ознакомьтесь с руководством по Python Начало работы с Imagen. Примечание: Генерация изображений — это платная функция, и она не будет работать, если вы используете бесплатный тарифный план. Дополнительную информацию см. на странице цен. Чтобы запустить следующую cell, ваш API key должен быть сохранён в секрете Colab под названием GEMINI_API_KEY. В следующем блоке кода вы можете изменить model_name, prompt и ряд параметров. Затем запрос будет отправлен с помощью curl. Модель обучена на длинных подписях и даст наилучшие результаты для более длинных и описательных prompt'ов. Короткие prompt'ы могут привести к низкой точности и более случайному output. Дополнительные рекомендации см. в руководстве по prompt'ам. Необязательные параметры: sampleCount: Сколько изображений будет сгенерировано. По умолчанию 4, допустимые значения 1-4. aspectRatio: Соотношение сторон генерируемых изображений. Поддерживаемые значения: 1:1, 3:4, 4:3, 16:9, 9:16.
План урока
- Настройка вашего API key
- Отправка запроса Imagen
- Изучение метаданных в ответе
- Проверка сгенерированных изображений
- Дальнейшие шаги
- Полезные ссылки на документацию
- Ознакомьтесь с этими интересными примерами Imagen
- Продолжите изучение Gemini API
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.