О чём урок
Добро пожаловать на первую страницу! Мы начинаем наше путешествие в увлекательный мир Reinforcement Learning (RL) и узнаем, как он революционизирует методы обучения языковых моделей, подобных тем, что вы, возможно, используете каждый день. [!TIP] В этой главе мы сосредоточимся на Reinforcement Learning для языковых моделей. Однако Reinforcement Learning — это обширная область со множеством применений за пределами языковых моделей. Если вы хотите узнать больше о Reinforcement Learning, рекомендуем ознакомиться с курсом по Deep Reinforcement Learning. Эта страница предоставит вам доступное и понятное введение в RL, даже если вы никогда раньше с ним не сталкивались. Мы разберем основные идеи и увидим, почему RL становится таким важным в области Large Language Models (LLM). Представьте, что вы дрессируете собаку. Вы хотите научить ее сидеть. Вы можете сказать «Сидеть!», а затем, если собака сядет, дать ей лакомство и похвалить. Если она не сядет, вы можете мягко направить ее или просто попробовать снова. Со временем собака учится ассоциировать сидение с положительным поощрением (лакомством и похвалой) и с большей вероятностью сядет, когда вы снова скажете «Сидеть!». В Reinforcement Learning мы называем эту обратную связь reward. Это, в двух словах, основная идея Reinforcement Learning! Вместо собаки у нас есть языковая модель (в Reinforcement Learning мы называем ее agent), а вместо вас — environment, которая дает обратную связь. Давайте разберем ключевые компоненты RL: Это наш обучающийся. В примере с собакой собака является agent. В контексте LLM сама LLM становится agent, которого мы хотим обучить. Agent — это тот, кто принимает решения и учится на основе environment и ее rewards. Это мир, в котором живет и с которым взаимодействует agent. Для собаки environment — это ваш дом и вы. Для LLM environment несколько более абстрактна — это могут быть пользователи, с которыми она взаимодействует, или смоделированный сценарий, который мы для нее создаем. Environment предоставляет обратную связь agent.
План урока
- Что такое Reinforcement Learning (RL)?
- Agent
- Environment
- Action
- Reward
- Policy
- Процесс RL: Метод проб и ошибок
- Роль RL в Large Language Models (LLM)
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.