Глубокое обучение с подкреплением

Урок 23 из 25 курса «Основы ИИ для начинающих»: официальный курс Microsoft AI for Beginners (Майкрософт) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Обучение с подкреплением (Reinforcement Learning, RL) считается одной из основных парадигм машинного обучения, наряду с обучением с учителем и обучением без учителя. Если в обучении с учителем мы опираемся на набор данных с известными результатами, то RL основано на обучении через действие. Например, когда вы впервые видите компьютерную игру, вы начинаете играть, даже не зная правил, и вскоре можете улучшить свои навыки просто благодаря процессу игры и корректировке своего поведения. Для выполнения RL вам потребуется: Среда или симулятор, который задаёт правила игры. Вы должны иметь возможность проводить эксперименты в симуляторе и наблюдать результаты. Некоторая функция вознаграждения, которая указывает, насколько успешным был ваш эксперимент. В случае обучения игре в компьютерную игру вознаграждением будет ваш итоговый счёт. На основе функции вознаграждения вы должны быть способны корректировать своё поведение и улучшать свои навыки, чтобы в следующий раз играть лучше. Основное отличие RL от других типов машинного обучения заключается в том, что в RL вы обычно не знаете, выиграли вы или проиграли, до тех пор, пока не закончите игру. Таким образом, нельзя сказать, является ли определённый ход сам по себе хорошим или плохим, вознаграждение вы получаете только в конце игры. Во время RL обычно проводится множество экспериментов. В каждом эксперименте необходимо находить баланс между следованием оптимальной стратегии, которую вы изучили до сих пор (эксплуатация), и исследованием новых возможных состояний (исследование). Отличным инструментом для RL является OpenAI Gym, среда симуляции, которая может моделировать множество различных сред, начиная от игр Atari и заканчивая физикой балансировки шеста. Это одна из самых популярных сред симуляции для обучения алгоритмов обучения с подкреплением, поддерживаемая OpenAI. Примечание: Вы можете увидеть все доступные среды OpenAI Gym здесь. Вы, вероятно, видели современные устройства для балансировки, такие как Segway или гироскутеры. Они способны автоматически балансировать, регулируя свои колёса в ответ на сигнал от акселерометра или гироскопа.

План урока

  1. Викторина перед лекцией
  2. OpenAI Gym
  3. Балансировка CartPole
  4. Алгоритм Policy Gradients
  5. Алгоритм Actor-Critic
  6. ✍️ Упражнения: Policy Gradients и Actor-Critic RL
  7. Другие задачи RL
  8. Заключение

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды