О чём урок
У нас готовы точные транскрипты подкастов для генерации аудио для нашего подкаста. В этом notebook мы научимся генерировать Audio, используя сначала модели suno/bark и parler-tts/parler-tts-mini-v1. После этого мы используем output из Notebook 3 для генерации нашего полного подкаста Примечание: Пожалуйста, не стесняйтесь расширять этот notebook новыми моделями. Две вышеупомянутые были выбраны после нескольких тестов с использованием sample prompt. ⚠️ Предупреждение: Этот notebook предпочитает версию transformers 4.43.3 или более раннюю, поэтому мы понизим версию нашего окружения, чтобы обеспечить бесперебойную работу Источник: Этот Colab был использован для стартового кода Мы можем установить эти пакеты для ускорения работы Импортируем необходимые фреймворки Попробуем сгенерировать аудио, используя обе модели, чтобы понять, как они работают. Обратите внимание на тонкие различия в prompting: Parler: Принимает description prompt, который можно использовать для настройки профиля диктора и скорости генерации Suno: Принимает выразительные слова, такие как [sigh], [laughs] и т. д. Вы можете найти больше заметок об экспериментах, проведенных для этого notebook, в файле TTS_Notes.md, чтобы узнать больше. Пожалуйста, установите device = "cuda" ниже, если вы используете single GPU node. Попробуем сначала использовать модель Parler и сгенерировать короткий сегмент голосом диктора Лоры
План урока
- Notebook 4: Рабочий процесс TTS
- Тестирование генерации Audio
- Модель Parler
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.