サットン&バルトの教科書から最新手法まで、デイビッド・シルバーの講義構成に沿って。
強化学習:サットン&バルトとデイビッド・シルバー(無料資料)
強化学習に入る最良の無料ルート二つ:サットン&バルトの教科書(無料PDF)とデイビッド・シルバーの講義(無料動画)。このシリーズを開くにあたり、入手先をまとめる。
強化学習 第1講:強化学習問題
デイビッド・シルバー講義の第1講。強化学習が他の学習と何が違うのか、報酬と状態、そしてエージェントを構成する三つの部品(方策・価値関数・モデル)まで。
強化学習 第2講:マルコフ決定過程
デイビッド・シルバー講義の第2講。強化学習の問題を収める器であるMDPを、マルコフ連鎖から報酬過程を経て決定過程まで、シルバーの「学生」の例とともに一層ずつ積み上げる。
強化学習 第3講:動的計画法
デイビッド・シルバー講義 第3講。MDPを完全に知っている状況で、ベルマン方程式を反復して解き、最適方策を計算する。方策評価・方策反復・価値反復を小さな格子世界の例で。
強化学習 第4講:モデルフリー予測
デイビッド・シルバー講義第4講。環境モデルなしに、経験だけで方策の価値を推定する。ブラックジャックのモンテカルロ、帰り道の時間的差分学習、ブートストラップとサンプリングの統合ビュー、そして適格度トレースのTD(λ)。
強化学習 第5講:モデルフリー制御
デイビッド・シルバー講義第5講。モデルなしで最適方策を見つける。なぜ状態価値ではなく行動価値なのか、二つの扉とε-貪欲とGLIE、風の吹く格子のSarsaとSarsa(λ)、重点サンプリングと方策オフ型、崖歩きで見るQ学習、そしてDPとTDの対応。
強化学習 第6講:価値関数近似
デイビッド・シルバー講義第6講。状態が多すぎて表に書ききれない大きな問題を、わずかなパラメータで近似する。勾配降下で特徴を学ぶ増分法、マウンテンカーとブートストラップ論争、オフ方策が発散するBairdの反例、そして経験を集めて解くバッチ法とDQNまで。
強化学習 第7講:方策勾配
デイビッド・シルバー講義第7講。価値を経由せず方策を直接最適化する。尤度比トリックとスコア関数、REINFORCE、ベースラインとアドバンテージ、actor-critic、自然方策勾配、そして六つの顔を一つにまとめる要約。
強化学習 第8講:学習と計画の統合
デイビッド・シルバー講義第8講。経験から環境モデルを学び、そのモデルで計画する。モデル学習は教師あり学習、AB例、DynaとDyna-Q+、モンテカルロ木探索と囲碁、TD探索とDyna-2。
強化学習 第9講:探索と活用
デイビッド・シルバー講義第9講。いま知っていることを使うか(活用)、もっと調べるか(探索)?このジレンマを五つの原理にまとめ、多腕バンディットにおけるリグレットと下界、UCB、トンプソンサンプリング、情報状態探索、そして文脈付きバンディットとMDPへの拡張までをたどる。
強化学習 第10講:ゲームにおける強化学習
デイビッド・シルバー講義 第10講。ケーススタディ。ゲーム理論から見た最適応答とナッシュ均衡、ミニマックス探索と二値線形価値関数、自己対戦強化学習、ミニマックスと強化学習の結合、そしてポーカーのような不完全情報ゲーム。Chinook・ディープブルー・Logistello・TD-Gammon・Mavenを貫く一つのレシピ。