Распознавание речи Whisper в Azure: второй вариант

Урок 115 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В примере показано, как использовать модель Azure OpenAI Whisper для транскрибирования аудиофайлов. Сначала мы установим необходимые зависимости и импортируем библиотеки, которые будем использовать. Сервис Azure OpenAI поддерживает несколько механизмов аутентификации, включая API ключи и учетные данные Azure Active Directory token. Чтобы настроить OpenAI SDK для использования ключа Azure API, нам нужно установить api_key в значение ключа, связанного с вашей конечной точкой (вы можете найти этот ключ в разделе "Ключи и конечные точки" в "Управлении ресурсами" на портале Azure). Здесь же вы найдете конечную точку для вашего ресурса. Теперь давайте посмотрим, как мы можем аутентифицироваться через Azure Active Directory. Мы начнем с установки библиотеки azure-identity. Эта библиотека предоставит учетные данные token, необходимые для аутентификации, и поможет нам создать провайдер учетных данных token с помощью вспомогательной функции get_bearer_token_provider. Рекомендуется использовать get_bearer_token_provider вместо предоставления статического token для AzureOpenAI, поскольку этот API будет автоматически кэшировать и обновлять tokens для вас. Для получения дополнительной информации о настройке аутентификации Azure Active Directory с Azure OpenAI см. документацию. Примечание: AzureOpenAI выводит следующие аргументы из соответствующих переменных среды, если они не предоставлены: api_key из AZURE_OPENAI_API_KEY azure_ad_token из AZURE_OPENAI_AD_TOKEN api_version из OPENAI_API_VERSION azure_endpoint из AZURE_OPENAI_ENDPOINT В этом разделе мы создадим развертывание, используя модель whisper-1 для транскрибирования аудиофайлов. Давайте развернем модель для использования с whisper. Перейдите на https://portal.azure.com, найдите свой ресурс Azure OpenAI, а затем перейдите в Azure OpenAI Studio. Нажмите на вкладку "Развертывания", а затем создайте развертывание для модели, которую вы хотите использовать для whisper. Имя развертывания, которое вы дадите модели, будет использоваться в коде ниже. Транскрибирование аудио, или преобразование речи в текст (speech-to-text), — это процесс преобразования произнесенных слов в текст. Используйте метод openai.Audio.transcribe для транскрибирования потока аудиофайла в текст.

План урока

  1. Настройка
  2. Аутентификация
  3. Аутентификация с использованием API ключа
  4. Аутентификация с использованием Azure Active Directory
  5. Развертывания
  6. Развертывания: Создание в Azure OpenAI Studio
  7. Транскрибирование аудио

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды