Обучение с подкреплением и зачем оно LLM

Урок 17 из 104 курса «HuggingFace: курс по Transformers»: официальный курс Hugging Face Learn (Хаггинг Фейс) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Добро пожаловать на первую страницу! Мы начинаем наше путешествие в увлекательный мир Reinforcement Learning (RL) и узнаем, как он революционизирует методы обучения языковых моделей, подобных тем, что вы, возможно, используете каждый день. [!TIP] В этой главе мы сосредоточимся на Reinforcement Learning для языковых моделей. Однако Reinforcement Learning — это обширная область со множеством применений за пределами языковых моделей. Если вы хотите узнать больше о Reinforcement Learning, рекомендуем ознакомиться с курсом по Deep Reinforcement Learning. Эта страница предоставит вам доступное и понятное введение в RL, даже если вы никогда раньше с ним не сталкивались. Мы разберем основные идеи и увидим, почему RL становится таким важным в области Large Language Models (LLM). Представьте, что вы дрессируете собаку. Вы хотите научить ее сидеть. Вы можете сказать «Сидеть!», а затем, если собака сядет, дать ей лакомство и похвалить. Если она не сядет, вы можете мягко направить ее или просто попробовать снова. Со временем собака учится ассоциировать сидение с положительным поощрением (лакомством и похвалой) и с большей вероятностью сядет, когда вы снова скажете «Сидеть!». В Reinforcement Learning мы называем эту обратную связь reward. Это, в двух словах, основная идея Reinforcement Learning! Вместо собаки у нас есть языковая модель (в Reinforcement Learning мы называем ее agent), а вместо вас — environment, которая дает обратную связь. Давайте разберем ключевые компоненты RL: Это наш обучающийся. В примере с собакой собака является agent. В контексте LLM сама LLM становится agent, которого мы хотим обучить. Agent — это тот, кто принимает решения и учится на основе environment и ее rewards. Это мир, в котором живет и с которым взаимодействует agent. Для собаки environment — это ваш дом и вы. Для LLM environment несколько более абстрактна — это могут быть пользователи, с которыми она взаимодействует, или смоделированный сценарий, который мы для нее создаем. Environment предоставляет обратную связь agent.

План урока

  1. Что такое Reinforcement Learning (RL)?
  2. Agent
  3. Environment
  4. Action
  5. Reward
  6. Policy
  7. Процесс RL: Метод проб и ошибок
  8. Роль RL в Large Language Models (LLM)

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды