LibreTimes

August 30, 2026 · Lecture · LibreTimes

Обучение с подкреплением

Обучение с подкреплением. Лекция курса «Машинное обучение» К. В. Воронцова. Задача о многоруком бандите. Жадные и эпсилон-жадные стратегии. Метод UCB (upper confidence bound).

Видеозаписи

Лекция

Семинар

Содержание лекции

  • Задача о многоруком бандите. Жадные и эпсилон-жадные стратегии. Метод UCB (upper confidence bound).
  • Адаптивные стратегии на основе скользящих средних. Метод сравнения с подкреплением. Метод преследования.
  • Постановка задачи в случае, когда агент влияет на среду. Ценность состояния среды. Ценность действия.
  • Жадные стратегии максимизации ценности. Уравнения оптимальности Беллмана.
  • Метод Q-обучения. Типизация методов на on-policy и off-policy.
  • Глубокое Q-обучение нейронной сети DQN на примере обучения играм Atari.
  • Градиентная оптимизация стратегии (policy gradient). Связь с максимизацией log-правдоподобия.
  • Модели актор-критик. Модели с непрерывным управлением.
  • Постановка задачи при моделировании среды. Типизация методов на model-free и model-based.
  • Контекстный многорукий бандит. Линейная регрессионная модель с верхней доверительной оценкой LinUCB.
  • Оценивание новой стратегии по большим историческим данным, сформированным при старых стратегиях.

Материалы

  • Презентация Voron-ML-RL-slides.pdf (PDF, 1.9 МБ) — прикреплена к публикации.

Материалы курса © К. В. Воронцов. Текст и слайды распространяются по лицензии CC BY-SA 3.0 — на условиях этой лицензии они воспроизведены здесь без изменений. Видеозаписи размещены на YouTube и встроены по ссылке; их копии здесь не хранятся.

1

No comments yet

Be the first to share your thoughts.