О чём урок
Gemini API может преобразовывать текстовый ввод в аудио, имитирующее подкаст с одним или несколькими дикторами, как в NotebookLM. Этот notebook демонстрирует, как управлять Text-to-speech (TTS) функцией модели Gemini и настраивать её стиль, акцент, темп и тон. Прежде чем углубляться в код, вы можете опробовать эту функцию в AI Studio. Обратите внимание, что TTS модель может выполнять только TTS; она не обладает возможностями рассуждения моделей Gemini, поэтому вы можете попросить её «сказать это в таком-то стиле», но не «рассказать, почему небо голубое». Если вам это нужно, следует использовать Live API вместо этого. Также документация является хорошим местом для начала изучения возможностей TTS. Чтобы запустить следующую cell, ваш API key должен быть сохранён в Colab Secret с именем GEMINI_API_KEY. Если у вас ещё нет API key или вы не знаете, как создать Colab Secret, см. Аутентификация для пошагового руководства. Вывод аудио поддерживается только "tts" моделями, такими как gemini-3.1-flash-tts-preview. Для получения дополнительной информации обо всех моделях Gemini ознакомьтесь с документацией для расширенной информации о каждой из них. Далее создайте вспомогательную функцию для отправки prompt модели и воспроизведения аудио в notebook: Начнём с чего-нибудь простого: Сгенерированное аудио находится в шагах ответа interaction. Извлечём аудиоданные: Чтобы прослушать сгенерированное аудио в colab, мы воспользуемся нашей вспомогательной функцией для записи вывода в файл и его воспроизведения.
План урока
- Настройка
- Настройка вашего API key
- Установка и инициализация SDK
- Выбор модели
- Генерация простого аудиовыхода
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.