この記事で強化学習シリーズを始める。デイビッド・シルバーの講義に沿って基礎を固め、PPOまで到達し、そこからより新しい手法へ進むのが目標だ。まず、資料をどこで無料で入手できるか。
教科書(無料)
サットン&バルト『Reinforcement Learning: An Introduction』(第2版、MIT Press 2018)はこの分野の標準教科書で、著者らが全文PDFを無料で公開している。
- 無料PDF: incompleteideas.net/book/RLbook2020.pdf
- 書籍ページ、コード・解答・正誤表: incompleteideas.net/book/the-book-2nd.html
講義(無料)
デイビッド・シルバーのUCL講義(2015)は、定番の動画入門だ。全10講で、このシリーズはその章立てに沿う。
- 講義ページとスライド: davidsilver.uk/teaching
第1講:
どこへ向かうか
教科書の基礎から方策勾配(policy gradient)法を経て、PPO(Schulman et al. 2017)まで進み、読書と講義を組み合わせていく。PPOはこの分野で最も新しいアイデアではない。今の強化学習が今なお頼りにしている働き者の手法であり、より新しい手法へ移る前の自然な里程標であって、終着点ではない。