Разбираем статью про DeepSeek R1

Урок 18 из 104 курса «HuggingFace: курс по Transformers»: официальный курс Hugging Face Learn (Хаггинг Фейс) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Эта глава — это краткий обзор статьи. Мы рассмотрим статью простыми словами, а затем разберем ключевые концепции и основные выводы. DeepSeek R1 представляет собой значительный прорыв в обучении языковых моделей, особенно в развитии способностей к рассуждению посредством обучения с подкреплением. В статье представлен новый алгоритм обучения с подкреплением, названный Group Relative Policy Optimization (GRPO). В следующей главе мы будем опираться на эти знания и реализуем GRPO на практике. Первоначальная цель статьи заключалась в исследовании, может ли чистое обучение с подкреплением развивать способности к рассуждению без supervised fine-tuning. [!СОВЕТ] До этого момента все популярные LLM требовали некоторого supervised fine-tuning, что мы рассмотрели в главе 11. Одним из самых примечательных открытий в процессе обучения R1-Zero стало появление феномена, известного как "момент озарения". Этот феномен чем-то похож на то, как люди испытывают внезапные озарения при решении проблем. Вот как это работает: Начальная попытка: Модель делает первую попытку решить проблему Распознавание: Она распознает потенциальные ошибки или несоответствия Самокоррекция: Она корректирует свой подход на основе этого распознавания Объяснение: Она может объяснить, почему новый подход лучше Этот прорыв находит отклик у обучающихся и ощущается как "Эврика!". Он демонстрирует обучение, а не простое запоминание, поэтому давайте на мгновение представим, каково это — испытать "момент озарения". Например, представьте, что вы пытаетесь решить головоломку: Первая попытка: "Эта деталь должна быть здесь по цвету" Распознавание: "Но подождите, форма не совсем подходит" Коррекция: "Ах, на самом деле она принадлежит туда" Объяснение: "Потому что и цвет, и форма совпадают в этой позиции" Эта способность возникла естественным образом из RL-обучения, без явного программирования, демонстрируя обучение, а не простое запоминание процесса из обучающих данных. Самый простой способ понять 'момент озарения' — это увидеть его в действии. Давайте рассмотрим пример. В чате ниже мы просим модель решить проблему, и UI показывает мыслительный процесс модели по мере ее решения.

План урока

  1. Прорывной 'момент озарения'
  2. Процесс обучения
  3. Фаза холодного старта (Основа качества)
  4. Фаза RL для рассуждений (Развитие способностей)
  5. Фаза выборки с отбраковкой (Контроль качества)
  6. Фаза разнообразного RL (Широкое выравнивание)
  7. Алгоритм: Group Relative Policy Optimization (GRPO)
  8. Формирование групп: Создание нескольких решений

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды