강화학습 2강: 마르코프 결정 과정

데이비드 실버 강의 2강. 강화학습 문제를 담는 그릇인 MDP를, 마르코프 연쇄에서 보상 과정을 거쳐 결정 과정까지 실버의 ‘학생’ 예제와 함께 한 층씩 쌓아 올린다.

2020년 10월 17일 · 4 분 · rick

강화학습 1강: 강화학습 문제

데이비드 실버 강의 1강. 강화학습이 다른 학습과 무엇이 다른지, 보상과 상태, 그리고 에이전트를 이루는 세 조각(정책·가치함수·모델)까지.

2020년 9월 19일 · 8 분 · rick

강화학습: 서튼 & 바르토와 데이비드 실버 (무료 자료)

강화학습에 들어가는 가장 좋은 무료 두 갈래: 서튼과 바르토의 교과서(무료 PDF)와 데이비드 실버의 강의(무료 영상). 시리즈를 여는 김에 어디서 받는지 정리한다.

2020년 9월 5일 · 1 분 · rick

정확도만 보면 속는다: 혼동행렬·정밀도·재현율·ROC·PR 직접 움직여보기

몸무게로 비만을 맞히는 아주 작은 분류기 하나로 분류 메트릭 전부를 관통한다. 혼동행렬(TP·FP·FN·TN), 정밀도·재현율·F1·정확도, 그리고 ROC·PR 커브까지. 결정경계를 손으로 옮기면 혼동행렬과 정밀도·재현율이 실시간으로 바뀌는 인터랙티브 위젯으로, ‘정확도 하나로는 왜 부족한가’를 눈으로 확인한다.

2020년 8월 30일 · 9 분 · rick