Переход с Whisper на GPT-Transcribe

Урок 206 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Новые модели транскрипции от OpenAI предоставляют существующим пользователям Whisper два целенаправленных пути обновления. GPT-Transcribe (gpt-transcribe) предназначен для точной транскрипции завершенного аудио через загруженные файлы. GPT-Live-Transcribe (gpt-live-transcribe) разработан для транскрипции в реальном времени с низкой задержкой и непрерывным потоком. На высоком уровне, API endpoints остаются прежними. Запросы файлов по-прежнему используют POST /v1/audio/transcriptions. Интеграции Realtime продолжают настраивать сессию транскрипции и обрабатывать события транскрипции. Отличия заключаются в поддерживаемых полях запроса, форматах вывода и контекстных/многоязычных подсказках. Транскрипция файлов использует существующий Audio API transcription endpoint. Транскрипция Realtime использует существующую Realtime transcription session, транспорт WebSocket или WebRTC и события транскрипции. Приложения по-прежнему предоставляют аудио, получают текст транскрипции и обрабатывают ошибки API или подключения. Используйте gpt-transcribe для завершенных файлов, потоковых транскрипций файлов или зафиксированных Realtime turns. Используйте gpt-live-transcribe для непрерывной потоковой транскрипции в реальном времени с низкой задержкой. Замените устаревшую подсказку language на массив languages новой модели. Используйте prompt для свободного контекста и keywords для буквальных терминов, ожидаемых в аудио. Обрабатывайте вывод обнаруженного языка для GPT-Transcribe, включая пустой массив languages. Записанные встречи, звонки или загруженное аудио: мигрируйте whisper-1 на gpt-transcribe через POST /v1/audio/transcriptions. Субтитры в реальном времени или непрерывно поступающее аудио с микрофона: мигрируйте gpt-realtime-whisper на gpt-live-transcribe в Realtime transcription session. Транскрипция с более высокой точностью после вручную зафиксированного audio turn: используйте gpt-transcribe в Realtime transcription session через WebSocket. Рассматривайте живое аудио и потоковый вывод как отдельные решения. Завершенный файл может генерировать события потоковой транскрипции, а Realtime session может ожидать фиксации audio turn перед генерацией дельт. Минимальная миграция файлов сохраняет endpoint, вызов SDK и загрузку файла. Замените идентификатор модели, затем обработайте JSON-ответ транскрипции. Python 3.11 или новее. OpenAI Python SDK: python -m pip install --upgrade openai. Переменная среды OPENAI_API_KEY. Завершенная запись с именем meeting.wav, или обновите audio_path, чтобы она указывала на ваш собственный файл.

План урока

  1. Обзор
  2. Что остается неизменным
  3. Что меняется
  4. 1. Выберите путь миграции
  5. 2. Миграция записанного аудио
  6. Предварительные условия
  7. 3. Обновление языковых подсказок и контекста предметной области
  8. 4. Потоковая транскрипция завершенного файла

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды