Цели урока
- Извлекать аккорды из музыкального видео на YouTube с помощью простого prompt.
- Использовать structured output с типизированной schema для получения предсказуемых данных об аккордах.
- Загрузить собственный аудиофайл и извлечь из него аккорды.
- Отобразить извлеченную информацию об аккордах.
О чём урок
Запустить в Google Colab Этот notebook демонстрирует, как использовать возможности Gemini API по пониманию аудио для извлечения последовательностей музыкальных аккордов из музыки. Вы узнаете, как: Примечание: Этот пример основан на первоначальной идее от jh941213 в #760. Чтобы запустить следующую cell, ваш API key должен быть сохранен в Colab Secret с именем GEMINI_API_KEY. Если у вас еще нет API key или вы не знаете, как создать Colab Secret, см. Authentication для примера. Выберите model для использования: Начните с загрузки музыкального файла. Пример ниже использует образец, сгенерированный с помощью Lyria, model для генерации музыки от Google DeepMind. Замените URL на ваш собственный аудиофайл или загрузите его напрямую, используя файловый браузер Colab. Прослушайте аудио: Загрузите файл в Gemini API с помощью File API и извлеките аккорды. Используйте JSON mode для получения structured output. Для более предсказуемых результатов определите schema, используя Python dataclasses, и передайте ее в response_schema. Это гарантирует, что output всегда будет соответствовать вашему ожидаемому формату. Дополнительные сведения см. в JSON mode quickstart. Теперь передайте dataclass ChordProgression в качестве response_schema. Prompt может быть значительно короче, поскольку schema уже описывает ожидаемый output. Выведите извлеченную информацию об аккордах в удобочитаемом формате. Вы также можете передать URL YouTube напрямую, ничего не загружая. Gemini анализирует аудиодорожку и определяет последовательность аккордов. Узнайте больше о понимании аудио в документации Gemini API. См. Audio quickstart для получения дополнительных примеров использования аудио. Ознакомьтесь с JSON mode quickstart для получения дополнительной информации о structured output. Изучите File API quickstart для получения дополнительной информации о загрузке файлов. Начало работы с Lyria: Генерируйте музыку с помощью model Lyria от Google DeepMind. Голосовые заметки: Суммируйте голосовые заметки с помощью Gemini.
План урока
- Настройка
- Установка SDK
- Настройка вашего API key
- Извлечение аккордов из аудиофайла
- Использование structured output со schema
- Определение model данных аккордов
- Извлечение аккордов со schema
- Отображение результатов
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.