Цели урока
- Транскрибирование заранее записанного аудио: Загрузите аудиофайл и получите точную текстовую транскрипцию с автоматическим определением языка.
- Управление языком и орфографией: Направляйте транскрипцию, используя стандартные языковые коды (например, es-ES для испанского).
- Пользовательский словарь (смещение речи): Научите model правильно писать специализированные слова, названия брендов или названия напитков из кофейни (Cortado, Macchiato).
- Отметки времени на уровне слов: Извлекайте точное время начала и окончания для каждого произнесенного слова.
- Идентификация докладчика (диаризация): Автоматически определяйте нескольких докладчиков и форматируйте реплики диалога.
О чём урок
Этот notebook покажет, как транскрибировать аудио и речь в текст с помощью моделей Gemini Transcribe. Независимо от того, нужно ли вам транскрибировать заранее записанные файлы подкастов, удалять слова-паразиты с помощью интеллектуального форматирования, генерировать синхронизированные субтитры с посекундными отметками времени для каждого слова, различать разных докладчиков на встрече или передавать потоковое аудио в реальном времени с микрофона с низкой задержкой, Gemini делает это простым. Интеллектуальная транскрипция (удаление слов-паразитов и форматирование): Автоматически удаляйте слова-паразиты («эм», «ну»), исправляйте самокоррекции и форматируйте произносимые списки/числа с помощью mode={"type": "smart"}. Программный экспорт субтитров: Создавайте стандартные файлы субтитров .srt на основе аннотаций отметок времени. Потоковая передача в реальном времени: Передавайте потоковые фрагменты аудио в реальном времени через WebSockets, используя gemini-3.5-transcribe-live. Безопасные клиентские токены: Выпускайте кратковременные, ограниченные токены для веб- и мобильных приложений. Что такое Interactions API? Interactions API (client.interactions.create) — это унифицированный интерфейс Gemini для мультимодальных задач, транскрипции речи и агентов. Он обрабатывает файловые входы, структурированные аннотации (такие как отметки времени и метки докладчиков) и многошаговые рабочие процессы. Установите Google GenAI SDK (google-genai версии 2.0 или выше) и soundfile для декодирования аудио: Чтобы запустить следующую cell, ваш API key должен быть сохранен в Colab Secret под именем GEMINI_API_KEY. Если у вас еще нет API key или вы не знаете, как создать Colab Secret, см. quickstart по Аутентификации для пошагового руководства. Установите идентификатор model для синхронной транскрипции аудио: Чтобы транскрибировать заранее записанное аудио, сначала загрузите аудиофайл с помощью File API (client.files.upload). Затем передайте загруженный файл в client.interactions.create. Gemini Transcribe автоматически определяет произносимый язык и возвращает транскрипцию:
План урока
- Что вы узнаете
- Настройка
- Установка SDK
- Настройка вашего API key
- Выбор model для транскрипции
- 1. Транскрибирование аудиофайла
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.