August 30, 2026 · Lecture · LibreTimes
Обучение с подкреплением
Обучение с подкреплением. Лекция курса «Машинное обучение» К. В. Воронцова. Задача о многоруком бандите. Жадные и эпсилон-жадные стратегии. Метод UCB (upper confidence bound).
Видеозаписи
Лекция
Семинар
Содержание лекции
- Задача о многоруком бандите. Жадные и эпсилон-жадные стратегии. Метод UCB (upper confidence bound).
- Адаптивные стратегии на основе скользящих средних. Метод сравнения с подкреплением. Метод преследования.
- Постановка задачи в случае, когда агент влияет на среду. Ценность состояния среды. Ценность действия.
- Жадные стратегии максимизации ценности. Уравнения оптимальности Беллмана.
- Метод Q-обучения. Типизация методов на on-policy и off-policy.
- Глубокое Q-обучение нейронной сети DQN на примере обучения играм Atari.
- Градиентная оптимизация стратегии (policy gradient). Связь с максимизацией log-правдоподобия.
- Модели актор-критик. Модели с непрерывным управлением.
- Постановка задачи при моделировании среды. Типизация методов на model-free и model-based.
- Контекстный многорукий бандит. Линейная регрессионная модель с верхней доверительной оценкой LinUCB.
- Оценивание новой стратегии по большим историческим данным, сформированным при старых стратегиях.
Материалы
- Презентация
Voron-ML-RL-slides.pdf(PDF, 1.9 МБ) — прикреплена к публикации.
Материалы курса © К. В. Воронцов. Текст и слайды распространяются по лицензии CC BY-SA 3.0 — на условиях этой лицензии они воспроизведены здесь без изменений. Видеозаписи размещены на YouTube и встроены по ссылке; их копии здесь не хранятся.
No comments yet
Be the first to share your thoughts.