이 글로 강화학습 시리즈를 연다. 데이비드 실버의 강의를 따라 기초를 다지고, PPO까지 올라간 뒤, 거기서부터 더 최근 방법으로 나아가는 게 목표다. 먼저 자료를 어디서 무료로 받는지부터.
책 (무료)
서튼과 바르토의 『Reinforcement Learning: An Introduction』(2판, MIT Press 2018)은 이 분야의 표준 교과서이고, 저자들이 전체 PDF를 무료로 공개해 둔다.
- 무료 PDF: incompleteideas.net/book/RLbook2020.pdf
- 책 페이지, 코드·해답·정오표: incompleteideas.net/book/the-book-2nd.html
강의 (무료)
데이비드 실버의 UCL 강의(2015)는 고전적인 영상 입문이다. 열 개의 강의로 되어 있고, 이 시리즈는 그 장 구성을 따라간다.
- 강의 페이지와 슬라이드: davidsilver.uk/teaching
1강:
어디로 가는가
교과서의 기초에서 정책 경사(policy gradient) 방법을 거쳐 PPO(Schulman et al. 2017)까지 나아가며, 읽기와 강의를 짝지어 간다. PPO는 이 분야에서 가장 새로운 아이디어는 아니다. 다만 요즘 강화학습이 여전히 기대고 있는 일꾼 같은 방법이라, 더 최근 방법으로 넘어가기 전의 자연스러운 이정표이지 종착점은 아니다.