О чём урок
В Главе 2, Разделе 2 мы видели, что генеративные языковые модели могут быть fine-tuned для выполнения конкретных задач, таких как резюмирование и ответы на вопросы. Однако в настоящее время гораздо чаще fine-tune языковые модели для одновременного выполнения широкого круга задач; этот метод известен как supervised fine-tuning (SFT). Этот процесс помогает моделям стать более универсальными и способными справляться с разнообразными сценариями использования. Большинство LLM, с которыми люди взаимодействуют на платформах вроде ChatGPT, прошли SFT, чтобы стать более полезными и соответствующими человеческим предпочтениям. Мы разделим эту главу на четыре раздела: Шаблоны чата структурируют взаимодействие между пользователями и моделями ИИ, обеспечивая последовательные и контекстуально уместные ответы. Они включают такие компоненты, как system prompts и ролевые сообщения. Supervised Fine-Tuning (SFT) — это критически важный процесс для адаптации предварительно обученных языковых моделей к конкретным задачам. Он включает обучение модели на наборе данных, специфичном для задачи, с размеченными примерами. Подробное руководство по SFT, включая ключевые шаги и лучшие практики, см. в разделе supervised fine-tuning документации TRL. Low Rank Adaptation (LoRA) — это техника для fine-tuning языковых моделей путем добавления низкоранговых матриц к слоям модели. Это позволяет эффективно fine-tune, сохраняя при этом предварительно обученные знания модели. Одним из ключевых преимуществ LoRA является значительная экономия памяти, которую она обеспечивает, что позволяет fine-tune большие модели на оборудовании с ограниченными ресурсами. Оценка — это важнейший шаг в процессе fine-tuning. Она позволяет нам измерять производительность модели на наборе данных, специфичном для задачи. [!СОВЕТ] ⚠️ Чтобы воспользоваться всеми функциями, доступными в Model Hub и 🤗 Transformers, мы рекомендуем создать аккаунт. Документация Transformers по шаблонам чата Скрипт для Supervised Fine-Tuning в TRL SFTTrainer в TRL Статья о Direct Preference Optimization Supervised Fine-Tuning с TRL Как fine-tune Google Gemma с ChatML и Hugging Face TRL Fine-tuning LLM для генерации каталогов персидских товаров в формате JSON
План урока
- 1️⃣ Шаблоны чата
- 2️⃣ Supervised Fine-Tuning
- 3️⃣ Low Rank Adaptation (LoRA)
- 4️⃣ Оценка
- Ссылки
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.