강화학습 4강: 모델 프리 예측
데이비드 실버 강의 4강. 환경 모델 없이 경험만으로 정책의 가치를 추정한다. 블랙잭의 몬테카를로, 퇴근길의 시간차 학습, 부트스트랩과 샘플링의 통합 뷰, 그리고 적격 흔적의 TD(λ).
데이비드 실버 강의 4강. 환경 모델 없이 경험만으로 정책의 가치를 추정한다. 블랙잭의 몬테카를로, 퇴근길의 시간차 학습, 부트스트랩과 샘플링의 통합 뷰, 그리고 적격 흔적의 TD(λ).
데이비드 실버 강의 3강. MDP를 완전히 아는 상황에서 벨만 방정식을 반복으로 풀어 최적 정책을 계산한다. 정책 평가·정책 반복·가치 반복을 작은 격자 세계 예제로.
데이비드 실버 강의 2강. 강화학습 문제를 담는 그릇인 MDP를, 마르코프 연쇄에서 보상 과정을 거쳐 결정 과정까지 실버의 ‘학생’ 예제와 함께 한 층씩 쌓아 올린다.
데이비드 실버 강의 1강. 강화학습이 다른 학습과 무엇이 다른지, 보상과 상태, 그리고 에이전트를 이루는 세 조각(정책·가치함수·모델)까지.