О чём урок
Для конвейера TTS были опробованы все ведущие модели с HuggingFace и Reddit. Цель состояла в использовании моделей, которые легко настраивались и звучали менее роботизированно, с возможностью включать звуковые эффекты, такие как смех и т.д. Минимальный код для запуска их моделей: Действительно примечательный аспект этих моделей — это возможность задавать description (описание) через prompt, что может изменять профиль говорящего и темп вывода. Удивительно, но мини-модель Parler звучала естественнее. В их репозитории они делятся именами дикторов, которые мы можем использовать в prompt. Минимальный код для запуска Bark: Подобно моделям Parler, Suno имеет библиотеку дикторов. v9 из их библиотеки звучала роботизированно, поэтому мы используем Parler для нашего первого диктора и лучшую модель от Bark. Невероятная особенность модели Bark — это возможность добавлять звуковые эффекты: [Laugh], [Gasps], [Sigh], [clears throat]; написание слов заглавными буквами заставляет модель их выделять. Добавление - создает паузу в тексте. Мы используем эти знания, когда переписываем транскрипцию, используя модель 8B, чтобы добавить эффекты в нашу транскрипцию. Примечание: Авторы предлагают использовать .... Однако это не сработало так эффективно, как добавление дефиса во время испытаний. Модели Bark имеют два параметра, которые мы можем настраивать: temperature и semantic_temperature Ниже приведены заметки по результатам прогона (sweep): prompt и диктор были зафиксированы, и это был vibe test, чтобы определить, что дает наилучшие результаты.
План урока
- Заметки по экспериментам с TTS
- Parler-TTS
- Suno/Bark
- Гиперпараметры
- Заметки по другим протестированным моделям
- Еще несколько моделей, которые не были протестированы
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.