이 글로 강화학습 시리즈를 연다. 데이비드 실버의 강의를 따라 기초를 다지고, PPO까지 올라간 뒤, 거기서부터 더 최근 방법으로 나아가는 게 목표다. 먼저 자료를 어디서 무료로 받는지부터.

책 (무료)

서튼과 바르토의 『Reinforcement Learning: An Introduction』(2판, MIT Press 2018)은 이 분야의 표준 교과서이고, 저자들이 전체 PDF를 무료로 공개해 둔다.

강의 (무료)

데이비드 실버의 UCL 강의(2015)는 고전적인 영상 입문이다. 열 개의 강의로 되어 있고, 이 시리즈는 그 장 구성을 따라간다.

1강:

어디로 가는가

교과서의 기초에서 정책 경사(policy gradient) 방법을 거쳐 PPO(Schulman et al. 2017)까지 나아가며, 읽기와 강의를 짝지어 간다. PPO는 이 분야에서 가장 새로운 아이디어는 아니다. 다만 요즘 강화학습이 여전히 기대고 있는 일꾼 같은 방법이라, 더 최근 방법으로 넘어가기 전의 자연스러운 이정표이지 종착점은 아니다.