강화학습 2강: 마르코프 결정 과정
데이비드 실버 강의 2강. 강화학습 문제를 담는 그릇인 MDP를, 마르코프 연쇄에서 보상 과정을 거쳐 결정 과정까지 실버의 ‘학생’ 예제와 함께 한 층씩 쌓아 올린다.
데이비드 실버 강의 2강. 강화학습 문제를 담는 그릇인 MDP를, 마르코프 연쇄에서 보상 과정을 거쳐 결정 과정까지 실버의 ‘학생’ 예제와 함께 한 층씩 쌓아 올린다.
데이비드 실버 강의 1강. 강화학습이 다른 학습과 무엇이 다른지, 보상과 상태, 그리고 에이전트를 이루는 세 조각(정책·가치함수·모델)까지.
강화학습에 들어가는 가장 좋은 무료 두 갈래: 서튼과 바르토의 교과서(무료 PDF)와 데이비드 실버의 강의(무료 영상). 시리즈를 여는 김에 어디서 받는지 정리한다.
몸무게로 비만을 맞히는 아주 작은 분류기 하나로 분류 메트릭 전부를 관통한다. 혼동행렬(TP·FP·FN·TN), 정밀도·재현율·F1·정확도, 그리고 ROC·PR 커브까지. 결정경계를 손으로 옮기면 혼동행렬과 정밀도·재현율이 실시간으로 바뀌는 인터랙티브 위젯으로, ‘정확도 하나로는 왜 부족한가’를 눈으로 확인한다.