시스템 생물학 1강: 기본 개념

유리 알론 1강. 세포를 회로처럼 읽는 관점에서 전사 네트워크, 입력 함수(힐 함수), 유전자 동역학, 그리고 반응 속도가 제거율만으로 정해진다는 핵심 결과까지.

2026년 7월 19일 · 4 분 · rick

맥케이 정보이론 3강: 엔트로피와 데이터 압축 (2): 정보원 부호화 정리, 편향 동전 복권

데이비드 맥케이 정보이론 강의 3강. 편향 동전 복권에서 전형적인 문자열을 세어 보고, 긴 자료가 기호당 엔트로피에 가까운 비트로 압축되는 이유를 정보원 부호화 정리로 이해한다.

2025년 1월 25일 · 3 분 · rick

맥케이 정보이론 2강: 엔트로피와 데이터 압축 (1): 압축·정보이론·엔트로피 입문

데이비드 맥케이 정보이론 강의 2강. 놀라운 사건일수록 정보가 많다는 생각에서 정보량과 엔트로피를 정의하고, 확률과 이진 부호 길이가 어떻게 연결되는지 살펴본다.

2025년 1월 18일 · 4 분 · rick

맥케이 정보이론 1강: 정보이론 입문

데이비드 맥케이 정보이론 강의 1강. 압축과 잡음 있는 통신, 추론이 왜 같은 확률의 언어로 만나는지 살펴보고, 정보이론이 묻는 두 가지 근본 한계를 세운다.

2025년 1월 11일 · 5 분 · rick

강화학습 10강: 게임 속 강화학습

데이비드 실버 강의 10강. 사례 연구. 게임이론으로 본 최선 대응과 내시 균형, 미니맥스 탐색과 이진-선형 가치함수, 자기 대국 강화학습, 미니맥스와 강화학습의 결합, 그리고 포커 같은 불완전정보 게임. 치누크·딥블루·로지스텔로·TD-개먼·메이븐을 관통하는 하나의 레시피.

2021년 6월 19일 · 11 분 · rick

강화학습 9강: 탐험과 활용

데이비드 실버 강의 9강. 지금 아는 걸 써먹을까(활용), 더 알아볼까(탐험)? 이 딜레마를 다섯 원리로 묶고, 다중 슬롯머신에서 후회와 하한, UCB, 톰프슨 표집, 정보 상태 탐색까지, 그리고 문맥 밴딧과 MDP로의 확장을 따라간다.

2021년 5월 15일 · 13 분 · rick

강화학습 8강: 학습과 계획의 통합

데이비드 실버 강의 8강. 경험에서 환경 모델을 배우고 그 모델로 계획한다. 모델 학습은 지도학습, AB 예제, Dyna와 Dyna-Q+, 몬테카를로 트리 탐색과 바둑, TD 탐색과 Dyna-2.

2021년 4월 17일 · 4 분 · rick

강화학습 7강: 정책 경사

데이비드 실버 강의 7강. 가치를 거치지 않고 정책을 직접 최적화한다. 우도비 트릭과 스코어 함수, REINFORCE, 베이스라인과 이점, 액터-크리틱, 자연 정책 경사, 그리고 여섯 얼굴을 하나로 묶는 요약.

2021년 3월 13일 · 4 분 · rick

강화학습 6강: 가치함수 근사

데이비드 실버 강의 6강. 상태가 너무 많아 표로 다 못 적는 큰 문제를 파라미터 몇 개로 근사한다. 경사하강으로 특징을 학습하는 증분법, 마운틴 카와 부트스트랩 논쟁, 오프폴리시가 발산하는 베어드 반례, 그리고 경험을 모아 푸는 배치법과 DQN까지.

2021년 2월 13일 · 9 분 · rick

강화학습 5강: 모델 프리 제어

데이비드 실버 강의 5강. 모델 없이 최적 정책을 찾는다. 왜 상태 가치가 아니라 행동 가치여야 하는가, 두 개의 문과 ε-탐욕과 GLIE, 바람 부는 격자의 Sarsa와 Sarsa(λ), 중요도 표본과 오프-폴리시, 벼랑 걷기로 보는 Q-러닝, 그리고 DP와 TD의 대응.

2021년 1월 16일 · 9 분 · rick