Open R1: курс для студентов

Урок 16 из 104 курса «HuggingFace: курс по Transformers»: официальный курс Hugging Face Learn (Хаггинг Фейс) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Добро пожаловать в увлекательное путешествие в мир open-source AI с обучением с подкреплением! Эта глава призвана помочь студентам понять обучение с подкреплением и его роль в LLM. Мы также рассмотрим Open R1 — новаторский общественный проект, который делает передовой AI доступным для каждого. В частности, этот курс призван помочь студентам и учащимся использовать Open R1 и вносить в него свой вклад. В этой главе мы разберем сложные концепции на легкоусвояемые части и покажем, как вы можете стать частью этого увлекательного проекта, чтобы научить LLM рассуждать над сложными задачами. LLM продемонстрировали отличную производительность во многих генеративных задачах. Однако до недавнего времени они испытывали трудности со сложными задачами, требующими рассуждений. Например, им трудно справляться с головоломками или математическими задачами, требующими многошаговых рассуждений. Open R1 — это проект, цель которого — научить LLM рассуждать над сложными задачами. Он делает это, используя обучение с подкреплением, чтобы побудить LLM «думать» и рассуждать. Проще говоря, модель обучается генерировать как мысли, так и выходные данные, и структурировать эти мысли и выходные данные таким образом, чтобы пользователь мог обрабатывать их по отдельности. Давайте рассмотрим пример. Если бы мы поставили себе задачу решить следующую проблему, мы могли бы рассуждать так: Затем мы можем структурировать эту мысль и ответ таким образом, чтобы пользователь мог обрабатывать их по отдельности. Для задач, требующих рассуждений, LLM могут быть обучены генерировать мысли и ответы в следующем формате: Как пользователь, мы можем затем извлечь мысль и ответ из выходных данных модели и использовать их для решения проблемы.

План урока

  1. Что вы узнаете
  2. Почему это важно для студентов
  3. Обзор главы
  4. 1️⃣ Введение в обучение с подкреплением и его роль в LLM
  5. 2️⃣ Понимание статьи DeepSeek R1
  6. 3️⃣ Реализация GRPO в TRL
  7. 4️⃣ Практический пример использования для выравнивания модели
  8. Предварительные требования

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды