강화학습 4강: 모델 프리 예측

데이비드 실버 강의 4강. 환경 모델 없이 경험만으로 정책의 가치를 추정한다. 블랙잭의 몬테카를로, 퇴근길의 시간차 학습, 부트스트랩과 샘플링의 통합 뷰, 그리고 적격 흔적의 TD(λ).

2020년 12월 12일 · 4 분 · rick

강화학습 3강: 동적 계획법

데이비드 실버 강의 3강. MDP를 완전히 아는 상황에서 벨만 방정식을 반복으로 풀어 최적 정책을 계산한다. 정책 평가·정책 반복·가치 반복을 작은 격자 세계 예제로.

2020년 11월 14일 · 4 분 · rick

강화학습 2강: 마르코프 결정 과정

데이비드 실버 강의 2강. 강화학습 문제를 담는 그릇인 MDP를, 마르코프 연쇄에서 보상 과정을 거쳐 결정 과정까지 실버의 ‘학생’ 예제와 함께 한 층씩 쌓아 올린다.

2020년 10월 17일 · 4 분 · rick

강화학습 1강: 강화학습 문제

데이비드 실버 강의 1강. 강화학습이 다른 학습과 무엇이 다른지, 보상과 상태, 그리고 에이전트를 이루는 세 조각(정책·가치함수·모델)까지.

2020년 9월 19일 · 8 분 · rick