Распознавание речи Whisper в Azure

Урок 110 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Примечание: Доступна более новая версия библиотеки openai. См. https://github.com/openai/openai-python/discussions/742 В этом примере показано, как использовать модель Azure OpenAI Whisper для транскрибирования аудиофайлов. Сначала установим необходимые зависимости. Далее мы импортируем наши библиотеки и настроим Python OpenAI SDK для работы с сервисом Azure OpenAI. Примечание: В этом примере мы настроили библиотеку для использования Azure API, задав переменные в коде. Для разработки рассмотрите возможность установки переменных окружения вместо этого: Для корректного доступа к сервису Azure OpenAI необходимо создать соответствующие ресурсы на портале Azure (подробное руководство по этому процессу можно найти в документации Microsoft) После создания ресурса первое, что нам понадобится, — это его endpoint. Вы можете получить endpoint, просмотрев раздел "Keys and Endpoints" в разделе "Resource Management". Используя эти данные, мы настроим SDK: Сервис Azure OpenAI поддерживает несколько механизмов аутентификации, включая API ключи и учетные данные Azure. Чтобы настроить OpenAI SDK для использования ключа Azure API, необходимо установить api_type в значение azure и присвоить api_key ключ, связанный с вашим endpoint (этот ключ можно найти в разделе "Keys and Endpoints" под разделом "Resource Management" на портале Azure) Теперь рассмотрим, как получить ключ с помощью аутентификации Microsoft Active Directory. Токен действителен в течение определенного периода времени, после чего он истекает. Чтобы гарантировать отправку действительного токена с каждым запросом, вы можете обновить истекающий токен, используя requests.auth: Транскрибирование аудио, или преобразование речи в текст (speech-to-text), — это процесс преобразования произнесенных слов в текстовый формат. Используйте метод openai.Audio.transcribe для транскрибирования потока аудиофайла в текст. Вы можете получить примеры аудиофайлов из репозитория Azure AI Speech SDK на GitHub.

План урока

  1. Настройка
  2. Аутентификация
  3. Аутентификация с использованием API ключа
  4. Аутентификация с использованием Azure Active Directory
  5. Транскрибирование аудио

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды