K-means, GMM, EM: 클러스터링의 세 겹 러시안 인형

K-means는 사실 GMM의 극단적 경우이고, GMM은 EM 알고리즘의 대표적 응용이다. 세 가지가 어떻게 하나의 프레임워크 안에서 연결되는지, 그리고 정보 기하학이 이 관계를 어떻게 설명하는지 직관적으로 풀어본다.

2023년 12월 10일 · 6 분 · rick

강화학습 10강: 게임 속 강화학습

데이비드 실버 강의 10강. 사례 연구. 게임이론으로 본 최선 대응과 내시 균형, 미니맥스 탐색과 이진-선형 가치함수, 자기 대국 강화학습, 미니맥스와 강화학습의 결합, 그리고 포커 같은 불완전정보 게임. 치누크·딥블루·로지스텔로·TD-개먼·메이븐을 관통하는 하나의 레시피.

2021년 6월 19일 · 11 분 · rick

강화학습 9강: 탐험과 활용

데이비드 실버 강의 9강. 지금 아는 걸 써먹을까(활용), 더 알아볼까(탐험)? 이 딜레마를 다섯 원리로 묶고, 다중 슬롯머신에서 후회와 하한, UCB, 톰프슨 표집, 정보 상태 탐색까지, 그리고 문맥 밴딧과 MDP로의 확장을 따라간다.

2021년 5월 15일 · 13 분 · rick

강화학습 8강: 학습과 계획의 통합

데이비드 실버 강의 8강. 경험에서 환경 모델을 배우고 그 모델로 계획한다. 모델 학습은 지도학습, AB 예제, Dyna와 Dyna-Q+, 몬테카를로 트리 탐색과 바둑, TD 탐색과 Dyna-2.

2021년 4월 17일 · 4 분 · rick

강화학습 7강: 정책 경사

데이비드 실버 강의 7강. 가치를 거치지 않고 정책을 직접 최적화한다. 우도비 트릭과 스코어 함수, REINFORCE, 베이스라인과 이점, 액터-크리틱, 자연 정책 경사, 그리고 여섯 얼굴을 하나로 묶는 요약.

2021년 3월 13일 · 4 분 · rick

강화학습 6강: 가치함수 근사

데이비드 실버 강의 6강. 상태가 너무 많아 표로 다 못 적는 큰 문제를 파라미터 몇 개로 근사한다. 경사하강으로 특징을 학습하는 증분법, 마운틴 카와 부트스트랩 논쟁, 오프폴리시가 발산하는 베어드 반례, 그리고 경험을 모아 푸는 배치법과 DQN까지.

2021년 2월 13일 · 9 분 · rick

강화학습 5강: 모델 프리 제어

데이비드 실버 강의 5강. 모델 없이 최적 정책을 찾는다. 왜 상태 가치가 아니라 행동 가치여야 하는가, 두 개의 문과 ε-탐욕과 GLIE, 바람 부는 격자의 Sarsa와 Sarsa(λ), 중요도 표본과 오프-폴리시, 벼랑 걷기로 보는 Q-러닝, 그리고 DP와 TD의 대응.

2021년 1월 16일 · 9 분 · rick

정보 기하학: AI는 어떻게 '가장 효율적으로' 배우는가

뉴턴의 F=ma가 물리 세계를 설명하듯, 정보 기하학은 AI가 배우는 과정을 설명합니다. 초보자를 위한 직관적 해설.

2021년 1월 9일 · 3 분 · rick

강화학습 4강: 모델 프리 예측

데이비드 실버 강의 4강. 환경 모델 없이 경험만으로 정책의 가치를 추정한다. 블랙잭의 몬테카를로, 퇴근길의 시간차 학습, 부트스트랩과 샘플링의 통합 뷰, 그리고 적격 흔적의 TD(λ).

2020년 12월 12일 · 4 분 · rick

강화학습 3강: 동적 계획법

데이비드 실버 강의 3강. MDP를 완전히 아는 상황에서 벨만 방정식을 반복으로 풀어 최적 정책을 계산한다. 정책 평가·정책 반복·가치 반복을 작은 격자 세계 예제로.

2020년 11월 14일 · 4 분 · rick