Описываем и озвучиваем видео с GPT-4.1-mini и TTS

Урок 25 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Этот notebook демонстрирует, как использовать визуальные возможности GPT с видео. Хотя GPT-4.1-mini не принимает видео напрямую в качестве input, мы можем использовать vision и контекстное окно в 1M token для описания статических кадров всего видео за один раз. Мы рассмотрим два примера: Использование GPT-4.1-mini для получения описания видео Генерация закадрового голоса для видео с помощью GPT-4o TTS API Сначала мы используем OpenCV для извлечения кадров из природного видео, на котором изображены бизоны и волки: Отобразим кадры, чтобы убедиться, что они были прочитаны корректно: Получив кадры видео, мы составляем наш prompt и отправляем запрос к GPT (Обратите внимание, что нам не нужно отправлять каждый кадр, чтобы GPT понял происходящее): Давайте создадим закадровый голос для этого видео в стиле Дэвида Аттенборо. Используя те же кадры видео, мы просим GPT предоставить нам короткий скрипт: Теперь мы можем работать с GPT-4o TTS model и предоставить ей набор инструкций о том, как должен звучать голос. Вы можете поэкспериментировать с voice models и instructions на OpenAI.fm. Затем мы можем передать скрипт, сгенерированный выше с помощью GPT-4.1-mini, и сгенерировать audio закадрового голоса:

План урока

  1. 1. Использование визуальных возможностей GPT для получения описания видео
  2. 2. Генерация закадрового голоса для видео с помощью GPT-4.1 и GPT-4o TTS API

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды