Расшифровка аудио и распознавание речи

Урок 36 из 69 курса «Gemini API: быстрый старт»: официальный курс Gemini API Cookbook (Гугл Джемини) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

Цели урока

  • Транскрибирование заранее записанного аудио: Загрузите аудиофайл и получите точную текстовую транскрипцию с автоматическим определением языка.
  • Управление языком и орфографией: Направляйте транскрипцию, используя стандартные языковые коды (например, es-ES для испанского).
  • Пользовательский словарь (смещение речи): Научите model правильно писать специализированные слова, названия брендов или названия напитков из кофейни (Cortado, Macchiato).
  • Отметки времени на уровне слов: Извлекайте точное время начала и окончания для каждого произнесенного слова.
  • Идентификация докладчика (диаризация): Автоматически определяйте нескольких докладчиков и форматируйте реплики диалога.

О чём урок

Этот notebook покажет, как транскрибировать аудио и речь в текст с помощью моделей Gemini Transcribe. Независимо от того, нужно ли вам транскрибировать заранее записанные файлы подкастов, удалять слова-паразиты с помощью интеллектуального форматирования, генерировать синхронизированные субтитры с посекундными отметками времени для каждого слова, различать разных докладчиков на встрече или передавать потоковое аудио в реальном времени с микрофона с низкой задержкой, Gemini делает это простым. Интеллектуальная транскрипция (удаление слов-паразитов и форматирование): Автоматически удаляйте слова-паразиты («эм», «ну»), исправляйте самокоррекции и форматируйте произносимые списки/числа с помощью mode={"type": "smart"}. Программный экспорт субтитров: Создавайте стандартные файлы субтитров .srt на основе аннотаций отметок времени. Потоковая передача в реальном времени: Передавайте потоковые фрагменты аудио в реальном времени через WebSockets, используя gemini-3.5-transcribe-live. Безопасные клиентские токены: Выпускайте кратковременные, ограниченные токены для веб- и мобильных приложений. Что такое Interactions API? Interactions API (client.interactions.create) — это унифицированный интерфейс Gemini для мультимодальных задач, транскрипции речи и агентов. Он обрабатывает файловые входы, структурированные аннотации (такие как отметки времени и метки докладчиков) и многошаговые рабочие процессы. Установите Google GenAI SDK (google-genai версии 2.0 или выше) и soundfile для декодирования аудио: Чтобы запустить следующую cell, ваш API key должен быть сохранен в Colab Secret под именем GEMINI_API_KEY. Если у вас еще нет API key или вы не знаете, как создать Colab Secret, см. quickstart по Аутентификации для пошагового руководства. Установите идентификатор model для синхронной транскрипции аудио: Чтобы транскрибировать заранее записанное аудио, сначала загрузите аудиофайл с помощью File API (client.files.upload). Затем передайте загруженный файл в client.interactions.create. Gemini Transcribe автоматически определяет произносимый язык и возвращает транскрипцию:

План урока

  1. Что вы узнаете
  2. Настройка
  3. Установка SDK
  4. Настройка вашего API key
  5. Выбор model для транскрипции
  6. 1. Транскрибирование аудиофайла

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды