この記事で強化学習シリーズを始める。デイビッド・シルバーの講義に沿って基礎を固め、PPOまで到達し、そこからより新しい手法へ進むのが目標だ。まず、資料をどこで無料で入手できるか。

教科書(無料)

サットン&バルト『Reinforcement Learning: An Introduction』(第2版、MIT Press 2018)はこの分野の標準教科書で、著者らが全文PDFを無料で公開している。

講義(無料)

デイビッド・シルバーのUCL講義(2015)は、定番の動画入門だ。全10講で、このシリーズはその章立てに沿う。

第1講:

どこへ向かうか

教科書の基礎から方策勾配(policy gradient)法を経て、PPO(Schulman et al. 2017)まで進み、読書と講義を組み合わせていく。PPOはこの分野で最も新しいアイデアではない。今の強化学習が今なお頼りにしている働き者の手法であり、より新しい手法へ移る前の自然な里程標であって、終着点ではない。