Приложения для живого перевода на gpt-realtime-translate

Урок 296 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

gpt-realtime-translate — это модель живого перевода речи в речь для создания многоязычных аудио-интерфейсов в трансляциях, стримах, звонках и видеоразговорах. Она принимает голосовой ввод, автоматически определяет исходный язык и возвращает переведенную речь, а также текстовые транскрипты. Разработчикам нужно лишь указать целевой язык вывода. Эта модель обладает двумя новыми функциями, которые делают ее уникально способной: В отличие от универсальных голосовых моделей, gpt-realtime-translate оптимизирована для устного перевода. Она была обучена на тысячах часов аудиозаписей профессиональных переводчиков, что помогает ей оставаться исключительно переводчиком и ждать достаточного контекста, прежде чем генерировать речь. Это особенно важно для языков с различной структурой предложений. Она может обрабатывать входное аудио, одновременно передавая переведенное аудио обратно в потоковом режиме. Это обеспечивает по-настоящему низкую latency при непрерывной речи. Мы создали gpt-realtime-translate, потому что живой устный перевод имеет иные требования, чем существующие голосовые AI-взаимодействия. Универсальные модели можно prompt'ить для перевода, но они все равно могут отвечать на вопросы или следовать инструкциям, а не переводить их. Они также полагаются на поочередное взаимодействие, требуя от говорящих делать паузы, пока модель генерирует переведенное аудио, что плохо подходит для беглого устного перевода. Это были основные препятствия для достижения высокой точности и низкой latency, необходимых для естественного живого устного перевода, и именно это мы решаем с помощью gpt-realtime-translate. Эта модель уникальна тем, что она в первую очередь направлена на предоставление людям возможности быть многоязычными, а не на создание голосовых AI-агентов. Если вы создаете голосовых агентов, используйте новую модель gpt-realtime-2. Мы видим два основных сценария использования gpt-realtime-translate. Первый — это перевод в стиле вещания: прямые трансляции, вебинары, лекции, отчетные звонки, основные доклады конференций и другие случаи, когда многим слушателям требуется переведенное аудио из одного основного источника в другой. Второй — это разговорный перевод, где два или более участников общаются друг с другом на разных языках: call-центры, видеочаты или другие рабочие процессы, основанные на телефонии.

План урока

  1. Как создавать с помощью Realtime Translation
  2. Что вы создадите
  3. Предварительные требования
  4. Основы API и сессий
  5. Ключевые отличия
  6. Жизненный цикл сессии
  7. Протоколы
  8. Перевод вкладки браузера

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды