Цели урока
- Потоковая передача с микрофона в реальном времени → конечная точка OpenAI Realtime (голос-в-голос).
- Мгновенные транскрипты и воспроизведение речи в каждом обмене репликами.
- Контейнер состояния диалога, который хранит каждое сообщение пользователя/ассистента.
- Автоматическая «обрезка контекста» – когда окно токенов становится очень большим (настраиваемым), старые реплики сжимаются в summary.
- Расширяемая архитектура, которую можно адаптировать для поддержки ботов клиентской поддержки, киосков или многоязычных ассистентов.
О чём урок
Создайте комплексного голосового бота, который слушает ваш микрофон, отвечает в реальном времени и суммирует длинные разговоры, чтобы качество никогда не снижалось. Требование Детали Python ≥ 3.10 Это гарантирует, что у вас не возникнет проблем OpenAI API key Установите OPENAI_API_KEY в вашей оболочке или вставьте непосредственно (не идеально для prod) Микрофон + динамики Предоставьте разрешение ОС, если будет предложено Нужна помощь с настройкой ключа? Следуйте официальному руководству по быстрому старту. Примечания: gpt-realtime поддерживает окно контекста в 32k токенов, хотя в некоторых случаях вы можете заметить снижение производительности по мере того, как вы помещаете больше токенов в окно контекста. Окно токенов = все токены (слова и аудиотокены), которые модель в данный момент хранит в памяти для сессии. Новые параметры API: Realtime API GA выпустил новый параметр truncation. Этот параметр автоматически оптимизирует обрезку контекста, сохраняя релевантную информацию и максимизируя частоту попаданий в кэш. Окна с большим количеством токенов ценны, каждый дополнительный токен, который вы используете, стоит задержки + денег.Для аудио входное окно токенов увеличивается гораздо быстрее, чем для обычного текста, потому что должны быть представлены амплитуда, тайминг и другие акустические детали. На практике вы часто будете видеть ≈ 10 × больше токенов для одного и того же предложения в аудио по сравнению с текстом. gpt-realtime принимает до 32k токенов, и по мере увеличения размера токенов соблюдение инструкций может ухудшаться. Каждый обмен репликами пользователя/ассистента потребляет токены → окно только растет. Стратегия: Суммируйте старые реплики в одно сообщение ассистента, сохраните последние несколько дословных реплик и продолжайте. Следующие вспомогательные функции позволят нам запустить весь скрипт.
План урока
- 1. Обзор
- Что вы узнаете
- Предварительные требования
- Установка одной строкой (запустите в новой cell)
- 2. Использование токенов – Текст против Голоса
- 3. Вспомогательные функции
- 3.1 Состояние диалога
- 3.2 · Потоковая передача аудио
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.