О чём урок
Эта глава — это краткий обзор статьи. Мы рассмотрим статью простыми словами, а затем разберем ключевые концепции и основные выводы. DeepSeek R1 представляет собой значительный прорыв в обучении языковых моделей, особенно в развитии способностей к рассуждению посредством обучения с подкреплением. В статье представлен новый алгоритм обучения с подкреплением, названный Group Relative Policy Optimization (GRPO). В следующей главе мы будем опираться на эти знания и реализуем GRPO на практике. Первоначальная цель статьи заключалась в исследовании, может ли чистое обучение с подкреплением развивать способности к рассуждению без supervised fine-tuning. [!СОВЕТ] До этого момента все популярные LLM требовали некоторого supervised fine-tuning, что мы рассмотрели в главе 11. Одним из самых примечательных открытий в процессе обучения R1-Zero стало появление феномена, известного как "момент озарения". Этот феномен чем-то похож на то, как люди испытывают внезапные озарения при решении проблем. Вот как это работает: Начальная попытка: Модель делает первую попытку решить проблему Распознавание: Она распознает потенциальные ошибки или несоответствия Самокоррекция: Она корректирует свой подход на основе этого распознавания Объяснение: Она может объяснить, почему новый подход лучше Этот прорыв находит отклик у обучающихся и ощущается как "Эврика!". Он демонстрирует обучение, а не простое запоминание, поэтому давайте на мгновение представим, каково это — испытать "момент озарения". Например, представьте, что вы пытаетесь решить головоломку: Первая попытка: "Эта деталь должна быть здесь по цвету" Распознавание: "Но подождите, форма не совсем подходит" Коррекция: "Ах, на самом деле она принадлежит туда" Объяснение: "Потому что и цвет, и форма совпадают в этой позиции" Эта способность возникла естественным образом из RL-обучения, без явного программирования, демонстрируя обучение, а не простое запоминание процесса из обучающих данных. Самый простой способ понять 'момент озарения' — это увидеть его в действии. Давайте рассмотрим пример. В чате ниже мы просим модель решить проблему, и UI показывает мыслительный процесс модели по мере ее решения.
План урока
- Прорывной 'момент озарения'
- Процесс обучения
- Фаза холодного старта (Основа качества)
- Фаза RL для рассуждений (Развитие способностей)
- Фаза выборки с отбраковкой (Контроль качества)
- Фаза разнообразного RL (Широкое выравнивание)
- Алгоритм: Group Relative Policy Optimization (GRPO)
- Формирование групп: Создание нескольких решений
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.