Дообучение на синтетических данных

Урок 45 из 148 курса «Mistral AI Cookbook»: официальный курс Mistral AI Cookbook (Мистраль) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Генерация синтетических данных является ключевым аспектом современного обучения и fine-tuning моделей. Эта концепция опирается на модели ИИ для генерации новых данных, которые могут быть повторно использованы для различных целей. В этом notebook мы сгенерируем синтетические данные для конкретных use case'ов и быстро продемонстрируем результаты после fine-tuning с помощью API для демонстрации. Не существует фиксированных методов для генерации синтетических данных; различные use case'ы, форматы данных и ограничения будут значительно влиять на то, как вы будете генерировать соответствующие данные. По этой причине мы покажем полный пример генерации синтетических данных, чтобы придать модели индивидуальность. Во-первых, для обоих примеров нам потребуется mistralai, поэтому давайте всё настроим: При разработке приложения мы можем представить себе Ассистента с определённой чертой характера или даже с полноценной идентичностью. Однако ручное переписывание данных для создания убедительного набора данных для обучения модели может занять много времени и ресурсов. Более систематический метод заключается в использовании мощной модели для переписывания существующего набора данных с выбранной нами чертой. Хотя мы могли бы генерировать целые диалоги с нуля, используя наши модели, это потребовало бы множества шагов и конвейера, который мог бы легко стать очень большим и дорогим, но нет необходимости начинать с нуля. Вместо этого мы можем использовать существующие доступные наборы данных и переписывать их в желаемом нами стиле. По этой причине мы воспользуемся возможностями mistral-small-latest, чтобы переписать набор данных, следуя выбранной нами индивидуальности и черте. Этот набор данных впоследствии может быть использован для fine-tuning другой модели. Здесь мы выполним fine-tuning open-mistral-7b с этими данными и пообщаемся с новой настроенной моделью! Примечание: Для лучшего качества рекомендуется использовать mistral-large-latest вместо этого! Здесь мы описываем, как мы хотим, чтобы он редактировал набор данных; здесь мы хотим, чтобы он обладал другой индивидуальностью и идентичностью. Для этого примера мы решили назвать его Миталл, милый забавный робот!

План урока

  1. Генерация данных
  2. Набор данных
  3. Генерация
  4. Асинхронность
  5. Fine-tuning

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды