О чём урок
Авторское право (c) Meta Platforms, Inc. и аффилированные лица. Это программное обеспечение может использоваться и распространяться в соответствии с условиями Лицензионного соглашения сообщества Llama. Этот notebook проведет вас через процесс дистилляции знаний модели из Llama 4 в меньшую модель Llama 3.2 с использованием синтетических обучающих данных из Synthetic Data Kit. Цель этого notebook — дистиллировать знания из более мощной модели (Llama 4 Scout) в меньшую, менее мощную модель (Llama 3.2 3B). Меньшие модели имеют несколько преимуществ по сравнению с более крупными: они быстрее генерируют текст, имеют меньшее время до первого token и обходятся дешевле в хостинге, поскольку требуют меньше оборудования. Однако более крупные модели, как правило, являются универсалами – то есть они способны хорошо выполнять широкий спектр задач. В специфических или специализированных задачах меньшие модели могут быть так же хороши, как и универсальные, более крупные модели. Дистилляция позволяет взять знания, присутствующие в более крупной модели, и передать их меньшей модели с минимальным снижением качества для узкоспециализированных задач. Этот notebook использует данные управления воздушным движением для демонстрации fine-tuning модели под специализированную область. В процессе дистилляции мы полностью сгенерируем пары с нуля, поскольку наша универсальная модель-учитель хорошо понимает фразеологию УВД. В ходе оценки мы будем оценивать как синтетические пары, так и реальные данные УВД. Мы будем использовать корпус ATCO2 данных воздушного движения, набор данных под лицензией MIT, который содержит аудиозаписи, транскрипции, а также дополнительную контекстную информацию и метаданные для каждого взаимодействия. Для этого упражнения мы будем использовать только текстовые транскрипции и небольшой (1 час) выборочный набор данных, чтобы продемонстрировать, как на самом деле необходимо лишь небольшое количество данных для fine-tuning модели. Для оценки нашей модели мы будем использовать стандартные метрики оценки языка, такие как perplexity и точность. Мы также будем использовать BLEU (bilingual evaluation understudy) для измерения сходства, не требуя, чтобы модель точно соответствовала каждому слову.
План урока
- Цель
- Данные
- Оценка
- Предварительные требования
- Требования к оборудованию
- Требования к программному обеспечению
- Подготовка окружения
- Генерация синтетического набора данных
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.