K-means, GMM, EM: 클러스터링의 세 겹 러시안 인형
K-means는 사실 GMM의 극단적 경우이고, GMM은 EM 알고리즘의 대표적 응용이다. 세 가지가 어떻게 하나의 프레임워크 안에서 연결되는지, 그리고 정보 기하학이 이 관계를 어떻게 설명하는지 직관적으로 풀어본다.
K-means는 사실 GMM의 극단적 경우이고, GMM은 EM 알고리즘의 대표적 응용이다. 세 가지가 어떻게 하나의 프레임워크 안에서 연결되는지, 그리고 정보 기하학이 이 관계를 어떻게 설명하는지 직관적으로 풀어본다.
데이비드 실버 강의 10강. 사례 연구. 게임이론으로 본 최선 대응과 내시 균형, 미니맥스 탐색과 이진-선형 가치함수, 자기 대국 강화학습, 미니맥스와 강화학습의 결합, 그리고 포커 같은 불완전정보 게임. 치누크·딥블루·로지스텔로·TD-개먼·메이븐을 관통하는 하나의 레시피.
데이비드 실버 강의 9강. 지금 아는 걸 써먹을까(활용), 더 알아볼까(탐험)? 이 딜레마를 다섯 원리로 묶고, 다중 슬롯머신에서 후회와 하한, UCB, 톰프슨 표집, 정보 상태 탐색까지, 그리고 문맥 밴딧과 MDP로의 확장을 따라간다.
데이비드 실버 강의 8강. 경험에서 환경 모델을 배우고 그 모델로 계획한다. 모델 학습은 지도학습, AB 예제, Dyna와 Dyna-Q+, 몬테카를로 트리 탐색과 바둑, TD 탐색과 Dyna-2.
데이비드 실버 강의 7강. 가치를 거치지 않고 정책을 직접 최적화한다. 우도비 트릭과 스코어 함수, REINFORCE, 베이스라인과 이점, 액터-크리틱, 자연 정책 경사, 그리고 여섯 얼굴을 하나로 묶는 요약.
데이비드 실버 강의 6강. 상태가 너무 많아 표로 다 못 적는 큰 문제를 파라미터 몇 개로 근사한다. 경사하강으로 특징을 학습하는 증분법, 마운틴 카와 부트스트랩 논쟁, 오프폴리시가 발산하는 베어드 반례, 그리고 경험을 모아 푸는 배치법과 DQN까지.
데이비드 실버 강의 5강. 모델 없이 최적 정책을 찾는다. 왜 상태 가치가 아니라 행동 가치여야 하는가, 두 개의 문과 ε-탐욕과 GLIE, 바람 부는 격자의 Sarsa와 Sarsa(λ), 중요도 표본과 오프-폴리시, 벼랑 걷기로 보는 Q-러닝, 그리고 DP와 TD의 대응.
뉴턴의 F=ma가 물리 세계를 설명하듯, 정보 기하학은 AI가 배우는 과정을 설명합니다. 초보자를 위한 직관적 해설.
데이비드 실버 강의 4강. 환경 모델 없이 경험만으로 정책의 가치를 추정한다. 블랙잭의 몬테카를로, 퇴근길의 시간차 학습, 부트스트랩과 샘플링의 통합 뷰, 그리고 적격 흔적의 TD(λ).
데이비드 실버 강의 3강. MDP를 완전히 아는 상황에서 벨만 방정식을 반복으로 풀어 최적 정책을 계산한다. 정책 평가·정책 반복·가치 반복을 작은 격자 세계 예제로.