О чём урок
Это руководство предназначено для разработчиков и специалистов по ML, имеющих опыт работы с API OpenAI и желающих использовать свои fine-tuned модели для исследований или других подходящих целей. Услуги OpenAI не предназначены для персонализированного лечения или диагностики каких-либо медицинских состояний и регулируются нашими применимыми условиями. В этом руководстве рассматриваются методы fine-tuning'а, поддерживаемые OpenAI, с особым акцентом на то, для чего каждый метод подходит лучше всего, а для чего — нет, чтобы помочь вам определить наиболее подходящую технику для вашего сценария использования. Затем оно подробно рассматривает один конкретный метод — Direct Preference Optimization (DPO) — и предоставляет ссылки на существующие руководства по другим техникам. Что такое fine-tuning? Fine-tuning — это процесс продолжения обучения на меньшем, предметно-ориентированном наборе данных для оптимизации модели под конкретную задачу. Обычно fine-tuning проводится по двум основным причинам: Улучшение производительности модели для конкретной задачи Повышение эффективности модели (сокращение необходимого количества token'ов, перенос знаний в меньшую модель и т.д.) В настоящее время платформа OpenAI поддерживает четыре метода fine-tuning'а: Supervised fine-tuning (SFT): эта техника использует традиционное обучение с учителем, применяя пары вход-выход для настройки параметров модели. Процесс обучения корректирует веса модели, чтобы минимизировать разницу между предсказанными и целевыми выходами по предоставленным примерам. Модель будет воспроизводить особенности, которые она находит в предоставленных парах. Vision fine-tuning: эта техника расширяет supervised fine-tuning на мультимодальные данные, обрабатывая как текст, так и изображения в единой обучающей среде. Процесс обучения корректирует веса модели, чтобы минимизировать ошибки в парах текст-изображение и, как следствие, улучшить понимание моделью входных изображений. Direct preference optimization (DPO): эта техника использует попарные сравнения (например, предпочитаемые и отклоненные примеры ответов) для оптимизации модели, чтобы она отдавала предпочтение одним выходам перед другими. Модель учится воспроизводить паттерны предпочтений, обнаруженные в предоставленных данных для сравнения. Reinforcement fine-tuning (RFT): эта техника использует обучение с подкреплением с сигналом вознаграждения (через оценщика или модель вознаграждения) для fine-tuning'а модели под сложные задачи.
План урока
- Руководство по Direct Preference Optimization
- 1. Рекомендуемый рабочий процесс
- 2. Демонстрационный сценарий
- 3. Генерация набора данных
- 4. Бенчмаркинг базовой модели
- 5. Fine-tuning
- 6. Использование вашей Fine-Tuned модели
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.