О чём урок
Новые модели транскрипции от OpenAI предоставляют существующим пользователям Whisper два целенаправленных пути обновления. GPT-Transcribe (gpt-transcribe) предназначен для точной транскрипции завершенного аудио через загруженные файлы. GPT-Live-Transcribe (gpt-live-transcribe) разработан для транскрипции в реальном времени с низкой задержкой и непрерывным потоком. На высоком уровне, API endpoints остаются прежними. Запросы файлов по-прежнему используют POST /v1/audio/transcriptions. Интеграции Realtime продолжают настраивать сессию транскрипции и обрабатывать события транскрипции. Отличия заключаются в поддерживаемых полях запроса, форматах вывода и контекстных/многоязычных подсказках. Транскрипция файлов использует существующий Audio API transcription endpoint. Транскрипция Realtime использует существующую Realtime transcription session, транспорт WebSocket или WebRTC и события транскрипции. Приложения по-прежнему предоставляют аудио, получают текст транскрипции и обрабатывают ошибки API или подключения. Используйте gpt-transcribe для завершенных файлов, потоковых транскрипций файлов или зафиксированных Realtime turns. Используйте gpt-live-transcribe для непрерывной потоковой транскрипции в реальном времени с низкой задержкой. Замените устаревшую подсказку language на массив languages новой модели. Используйте prompt для свободного контекста и keywords для буквальных терминов, ожидаемых в аудио. Обрабатывайте вывод обнаруженного языка для GPT-Transcribe, включая пустой массив languages. Записанные встречи, звонки или загруженное аудио: мигрируйте whisper-1 на gpt-transcribe через POST /v1/audio/transcriptions. Субтитры в реальном времени или непрерывно поступающее аудио с микрофона: мигрируйте gpt-realtime-whisper на gpt-live-transcribe в Realtime transcription session. Транскрипция с более высокой точностью после вручную зафиксированного audio turn: используйте gpt-transcribe в Realtime transcription session через WebSocket. Рассматривайте живое аудио и потоковый вывод как отдельные решения. Завершенный файл может генерировать события потоковой транскрипции, а Realtime session может ожидать фиксации audio turn перед генерацией дельт. Минимальная миграция файлов сохраняет endpoint, вызов SDK и загрузку файла. Замените идентификатор модели, затем обработайте JSON-ответ транскрипции. Python 3.11 или новее. OpenAI Python SDK: python -m pip install --upgrade openai. Переменная среды OPENAI_API_KEY. Завершенная запись с именем meeting.wav, или обновите audio_path, чтобы она указывала на ваш собственный файл.
План урока
- Обзор
- Что остается неизменным
- Что меняется
- 1. Выберите путь миграции
- 2. Миграция записанного аудио
- Предварительные условия
- 3. Обновление языковых подсказок и контекста предметной области
- 4. Потоковая транскрипция завершенного файла
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.