О чём урок
Одна из самых захватывающих особенностей Realtime API заключается в том, что эмоции, тон и темп речи передаются модели для инференса. Традиционные каскадные голосовые системы (включающие STT и TTS) вводят промежуточный этап транскрипции, полагаясь на SSML или prompt'ы для аппроксимации просодии, что неизбежно приводит к потере точности. Выразительность говорящего буквально теряется при переводе. Поскольку Realtime API может обрабатывать необработанный звук, он сохраняет эти звуковые атрибуты на этапе инференса, минимизируя latency и обогащая ответы тональными и интонационными подсказками. Благодаря этому Realtime API делает речевой перевод на основе LLM ближе к работе живого переводчика, чем когда-либо прежде. Этот cookbook демонстрирует, как использовать Realtime API от OpenAI для создания многоязычного одностороннего рабочего процесса перевода с помощью WebSockets. Он реализован с использованием интеграции Realtime + WebSockets в приложении для говорящего и WebSocket-сервера для зеркалирования переведенного аудио в приложение для слушателя. Реальный сценарий использования для этой демонстрации — многоязычный разговорный перевод, где говорящий произносит речь в приложение для говорящего, а слушатели слышат переводы на выбранном ими родном языке через приложение для слушателя. Представьте конференц-зал, где докладчик говорит по-английски, а участник в наушниках выбирает прослушивание перевода на тагальский язык. Из-за текущей пошаговой природы аудиомоделей говорящий должен делать короткие паузы, чтобы модель могла обработать и перевести речь. Однако по мере того, как модели становятся быстрее и эффективнее, эта latency значительно уменьшится, и перевод станет более плавным. Давайте рассмотрим основные функциональные возможности и фрагменты кода, которые иллюстрируют работу приложения. Вы можете найти код в сопутствующем репозитории, если хотите запустить приложение локально. Этот проект состоит из двух приложений — для говорящего и для слушателя. Приложение для говорящего принимает аудио из браузера, разветвляет его и создает уникальную Realtime-сессию для каждого языка, отправляя ее в OpenAI Realtime API через WebSocket. Переведенное аудио возвращается потоком и зеркалируется через отдельный WebSocket-сервер в приложение для слушателя.
План урока
- Обзор высокоуровневой архитектуры
- Шаг 1: Настройка языка и Prompt'а
- Шаг 2: Настройка приложения для говорящего
- Шаг 3: Потоковая передача аудио
- Шаг 4: Отображение транскрипций
- Шаг 5: Настройка приложения для слушателя
- От POC к Production
- Заключение
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.