強化学習 第7講:方策勾配
デイビッド・シルバー講義第7講。価値を経由せず方策を直接最適化する。尤度比トリックとスコア関数、REINFORCE、ベースラインとアドバンテージ、actor-critic、自然方策勾配、そして六つの顔を一つにまとめる要約。
デイビッド・シルバー講義第7講。価値を経由せず方策を直接最適化する。尤度比トリックとスコア関数、REINFORCE、ベースラインとアドバンテージ、actor-critic、自然方策勾配、そして六つの顔を一つにまとめる要約。
デイビッド・シルバー講義第6講。状態が多すぎて表に書ききれない大きな問題を、わずかなパラメータで近似する。勾配降下で特徴を学ぶ増分法、マウンテンカーとブートストラップ論争、オフ方策が発散するBairdの反例、そして経験を集めて解くバッチ法とDQNまで。
デイビッド・シルバー講義第5講。モデルなしで最適方策を見つける。なぜ状態価値ではなく行動価値なのか、二つの扉とε-貪欲とGLIE、風の吹く格子のSarsaとSarsa(λ)、重点サンプリングと方策オフ型、崖歩きで見るQ学習、そしてDPとTDの対応。
ニュートンのF=maが物理世界を説明するように、情報幾何学はAIの学習過程を説明します。初心者向けの直感的な解説。
デイビッド・シルバー講義第4講。環境モデルなしに、経験だけで方策の価値を推定する。ブラックジャックのモンテカルロ、帰り道の時間的差分学習、ブートストラップとサンプリングの統合ビュー、そして適格度トレースのTD(λ)。
デイビッド・シルバー講義 第3講。MDPを完全に知っている状況で、ベルマン方程式を反復して解き、最適方策を計算する。方策評価・方策反復・価値反復を小さな格子世界の例で。
デイビッド・シルバー講義の第2講。強化学習の問題を収める器であるMDPを、マルコフ連鎖から報酬過程を経て決定過程まで、シルバーの「学生」の例とともに一層ずつ積み上げる。
デイビッド・シルバー講義の第1講。強化学習が他の学習と何が違うのか、報酬と状態、そしてエージェントを構成する三つの部品(方策・価値関数・モデル)まで。
強化学習に入る最良の無料ルート二つ:サットン&バルトの教科書(無料PDF)とデイビッド・シルバーの講義(無料動画)。このシリーズを開くにあたり、入手先をまとめる。