SFT, DPO или RFT: какое дообучение выбрать

Урок 21 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Это руководство предназначено для разработчиков и специалистов по ML, имеющих опыт работы с API OpenAI и желающих использовать свои fine-tuned модели для исследований или других подходящих целей. Услуги OpenAI не предназначены для персонализированного лечения или диагностики каких-либо медицинских состояний и регулируются нашими применимыми условиями. В этом руководстве рассматриваются методы fine-tuning'а, поддерживаемые OpenAI, с особым акцентом на то, для чего каждый метод подходит лучше всего, а для чего — нет, чтобы помочь вам определить наиболее подходящую технику для вашего сценария использования. Затем оно подробно рассматривает один конкретный метод — Direct Preference Optimization (DPO) — и предоставляет ссылки на существующие руководства по другим техникам. Что такое fine-tuning? Fine-tuning — это процесс продолжения обучения на меньшем, предметно-ориентированном наборе данных для оптимизации модели под конкретную задачу. Обычно fine-tuning проводится по двум основным причинам: Улучшение производительности модели для конкретной задачи Повышение эффективности модели (сокращение необходимого количества token'ов, перенос знаний в меньшую модель и т.д.) В настоящее время платформа OpenAI поддерживает четыре метода fine-tuning'а: Supervised fine-tuning (SFT): эта техника использует традиционное обучение с учителем, применяя пары вход-выход для настройки параметров модели. Процесс обучения корректирует веса модели, чтобы минимизировать разницу между предсказанными и целевыми выходами по предоставленным примерам. Модель будет воспроизводить особенности, которые она находит в предоставленных парах. Vision fine-tuning: эта техника расширяет supervised fine-tuning на мультимодальные данные, обрабатывая как текст, так и изображения в единой обучающей среде. Процесс обучения корректирует веса модели, чтобы минимизировать ошибки в парах текст-изображение и, как следствие, улучшить понимание моделью входных изображений. Direct preference optimization (DPO): эта техника использует попарные сравнения (например, предпочитаемые и отклоненные примеры ответов) для оптимизации модели, чтобы она отдавала предпочтение одним выходам перед другими. Модель учится воспроизводить паттерны предпочтений, обнаруженные в предоставленных данных для сравнения. Reinforcement fine-tuning (RFT): эта техника использует обучение с подкреплением с сигналом вознаграждения (через оценщика или модель вознаграждения) для fine-tuning'а модели под сложные задачи.

План урока

  1. Руководство по Direct Preference Optimization
  2. 1. Рекомендуемый рабочий процесс
  3. 2. Демонстрационный сценарий
  4. 3. Генерация набора данных
  5. 4. Бенчмаркинг базовой модели
  6. 5. Fine-tuning
  7. 6. Использование вашей Fine-Tuned модели

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды