О чём урок
Предварительная версия: Live API находится на стадии предварительной версии. Этот notebook демонстрирует использование Gemini Live API для перевода аудио в реальном времени. Обзор новых возможностей представлен в документации Gemini Live API. Некоторые функции API (такие как двунаправленный голосовой и видео streaming с низкой задержкой с использованием локального микрофона и камеры) не поддерживаются в стандартной среде Colab из-за ее безголовой облачной VM-природы. Чтобы опробовать полноценный локальный аппаратный streaming, ознакомьтесь с примерами CLI в репозитории Cookbook. В этом notebook вы узнаете, как streamить и переводить аудио с URL в реальном времени с использованием Live Translation API, отображая live-транскрипции и воспроизводя переведенный аудио output. Новый Google Gen AI SDK предоставляет программный доступ к Gemini. Примечание: Этот notebook также использует ffmpeg для обработки аудио stream. ffmpeg предустановлен в средах Google Colab. Чтобы запустить следующую cell, ваш API key должен быть сохранен в Colab Secret с именем GEMINI_API_KEY. Если у вас еще нет API key или вы не знаете, как создать Colab Secret, см. Аутентификация для получения подробной информации. Client получит ваш API key из переменной среды. Live Translation API использует Live models, способные к переводу. Импортируйте необходимые пакеты для обработки асинхронных событий, аудио format streams и записи файлов. Определим вспомогательный context manager для записи полученных аудио-chunks в .wav файл для воспроизведения в notebook: Вы можете streamить аудио в реальном времени в Live API и получать переведенное аудио обратно. Здесь вы будете streamить аудио с публичного аудио URL 100-миллисекундными chunks, чтобы имитировать ввод аудио в реальном времени, и получать stream-ответы перевода обратно. Вы определяете вспомогательную функцию для streamинга аудио с HTTP URL и используете ffmpeg для его транскодирования в необработанное монофоническое аудио PCM 16 кГц. Далее вы определяете функции для отправки аудио-chunks из очереди в Live-сессию, а также для получения и вывода исходных и переведенных transcripts. Теперь настройте основной исполнитель перевода.
План урока
- Настройка
- Установка SDK и зависимостей
- Настройка вашего API key
- Инициализация SDK client
- Выбор model
- Импорт модулей
- Вспомогательная функция для записи WAV-файлов
- Streaming аудио с URL и перевод
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.