Дистилляция: учим маленькую модель у большой

Урок 4 из 17 курса «Llama: начало работы»: официальный курс Llama Cookbook (Мета Лама) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Авторское право (c) Meta Platforms, Inc. и аффилированные лица. Это программное обеспечение может использоваться и распространяться в соответствии с условиями Лицензионного соглашения сообщества Llama. Этот notebook проведет вас через процесс дистилляции знаний модели из Llama 4 в меньшую модель Llama 3.2 с использованием синтетических обучающих данных из Synthetic Data Kit. Цель этого notebook — дистиллировать знания из более мощной модели (Llama 4 Scout) в меньшую, менее мощную модель (Llama 3.2 3B). Меньшие модели имеют несколько преимуществ по сравнению с более крупными: они быстрее генерируют текст, имеют меньшее время до первого token и обходятся дешевле в хостинге, поскольку требуют меньше оборудования. Однако более крупные модели, как правило, являются универсалами – то есть они способны хорошо выполнять широкий спектр задач. В специфических или специализированных задачах меньшие модели могут быть так же хороши, как и универсальные, более крупные модели. Дистилляция позволяет взять знания, присутствующие в более крупной модели, и передать их меньшей модели с минимальным снижением качества для узкоспециализированных задач. Этот notebook использует данные управления воздушным движением для демонстрации fine-tuning модели под специализированную область. В процессе дистилляции мы полностью сгенерируем пары с нуля, поскольку наша универсальная модель-учитель хорошо понимает фразеологию УВД. В ходе оценки мы будем оценивать как синтетические пары, так и реальные данные УВД. Мы будем использовать корпус ATCO2 данных воздушного движения, набор данных под лицензией MIT, который содержит аудиозаписи, транскрипции, а также дополнительную контекстную информацию и метаданные для каждого взаимодействия. Для этого упражнения мы будем использовать только текстовые транскрипции и небольшой (1 час) выборочный набор данных, чтобы продемонстрировать, как на самом деле необходимо лишь небольшое количество данных для fine-tuning модели. Для оценки нашей модели мы будем использовать стандартные метрики оценки языка, такие как perplexity и точность. Мы также будем использовать BLEU (bilingual evaluation understudy) для измерения сходства, не требуя, чтобы модель точно соответствовала каждому слову.

План урока

  1. Цель
  2. Данные
  3. Оценка
  4. Предварительные требования
  5. Требования к оборудованию
  6. Требования к программному обеспечению
  7. Подготовка окружения
  8. Генерация синтетического набора данных

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды