Вытаскиваем аккорды из аудиозаписи

Урок 9 из 80 курса «Gemini API: примеры использования»: официальный курс Gemini API Cookbook (Гугл Джемини) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

Цели урока

  • Извлекать аккорды из музыкального видео на YouTube с помощью простого prompt.
  • Использовать structured output с типизированной schema для получения предсказуемых данных об аккордах.
  • Загрузить собственный аудиофайл и извлечь из него аккорды.
  • Отобразить извлеченную информацию об аккордах.

О чём урок

Запустить в Google Colab Этот notebook демонстрирует, как использовать возможности Gemini API по пониманию аудио для извлечения последовательностей музыкальных аккордов из музыки. Вы узнаете, как: Примечание: Этот пример основан на первоначальной идее от jh941213 в #760. Чтобы запустить следующую cell, ваш API key должен быть сохранен в Colab Secret с именем GEMINI_API_KEY. Если у вас еще нет API key или вы не знаете, как создать Colab Secret, см. Authentication для примера. Выберите model для использования: Начните с загрузки музыкального файла. Пример ниже использует образец, сгенерированный с помощью Lyria, model для генерации музыки от Google DeepMind. Замените URL на ваш собственный аудиофайл или загрузите его напрямую, используя файловый браузер Colab. Прослушайте аудио: Загрузите файл в Gemini API с помощью File API и извлеките аккорды. Используйте JSON mode для получения structured output. Для более предсказуемых результатов определите schema, используя Python dataclasses, и передайте ее в response_schema. Это гарантирует, что output всегда будет соответствовать вашему ожидаемому формату. Дополнительные сведения см. в JSON mode quickstart. Теперь передайте dataclass ChordProgression в качестве response_schema. Prompt может быть значительно короче, поскольку schema уже описывает ожидаемый output. Выведите извлеченную информацию об аккордах в удобочитаемом формате. Вы также можете передать URL YouTube напрямую, ничего не загружая. Gemini анализирует аудиодорожку и определяет последовательность аккордов. Узнайте больше о понимании аудио в документации Gemini API. См. Audio quickstart для получения дополнительных примеров использования аудио. Ознакомьтесь с JSON mode quickstart для получения дополнительной информации о structured output. Изучите File API quickstart для получения дополнительной информации о загрузке файлов. Начало работы с Lyria: Генерируйте музыку с помощью model Lyria от Google DeepMind. Голосовые заметки: Суммируйте голосовые заметки с помощью Gemini.

План урока

  1. Настройка
  2. Установка SDK
  3. Настройка вашего API key
  4. Извлечение аккордов из аудиофайла
  5. Использование structured output со schema
  6. Определение model данных аккордов
  7. Извлечение аккордов со schema
  8. Отображение результатов

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды