시스템 생물학 1강: 기본 개념
유리 알론 1강. 세포를 회로처럼 읽는 관점에서 전사 네트워크, 입력 함수(힐 함수), 유전자 동역학, 그리고 반응 속도가 제거율만으로 정해진다는 핵심 결과까지.
유리 알론 1강. 세포를 회로처럼 읽는 관점에서 전사 네트워크, 입력 함수(힐 함수), 유전자 동역학, 그리고 반응 속도가 제거율만으로 정해진다는 핵심 결과까지.
데이비드 맥케이 정보이론 강의 3강. 편향 동전 복권에서 전형적인 문자열을 세어 보고, 긴 자료가 기호당 엔트로피에 가까운 비트로 압축되는 이유를 정보원 부호화 정리로 이해한다.
데이비드 맥케이 정보이론 강의 2강. 놀라운 사건일수록 정보가 많다는 생각에서 정보량과 엔트로피를 정의하고, 확률과 이진 부호 길이가 어떻게 연결되는지 살펴본다.
데이비드 맥케이 정보이론 강의 1강. 압축과 잡음 있는 통신, 추론이 왜 같은 확률의 언어로 만나는지 살펴보고, 정보이론이 묻는 두 가지 근본 한계를 세운다.
데이비드 실버 강의 10강. 사례 연구. 게임이론으로 본 최선 대응과 내시 균형, 미니맥스 탐색과 이진-선형 가치함수, 자기 대국 강화학습, 미니맥스와 강화학습의 결합, 그리고 포커 같은 불완전정보 게임. 치누크·딥블루·로지스텔로·TD-개먼·메이븐을 관통하는 하나의 레시피.
데이비드 실버 강의 9강. 지금 아는 걸 써먹을까(활용), 더 알아볼까(탐험)? 이 딜레마를 다섯 원리로 묶고, 다중 슬롯머신에서 후회와 하한, UCB, 톰프슨 표집, 정보 상태 탐색까지, 그리고 문맥 밴딧과 MDP로의 확장을 따라간다.
데이비드 실버 강의 8강. 경험에서 환경 모델을 배우고 그 모델로 계획한다. 모델 학습은 지도학습, AB 예제, Dyna와 Dyna-Q+, 몬테카를로 트리 탐색과 바둑, TD 탐색과 Dyna-2.
데이비드 실버 강의 7강. 가치를 거치지 않고 정책을 직접 최적화한다. 우도비 트릭과 스코어 함수, REINFORCE, 베이스라인과 이점, 액터-크리틱, 자연 정책 경사, 그리고 여섯 얼굴을 하나로 묶는 요약.
데이비드 실버 강의 6강. 상태가 너무 많아 표로 다 못 적는 큰 문제를 파라미터 몇 개로 근사한다. 경사하강으로 특징을 학습하는 증분법, 마운틴 카와 부트스트랩 논쟁, 오프폴리시가 발산하는 베어드 반례, 그리고 경험을 모아 푸는 배치법과 DQN까지.
데이비드 실버 강의 5강. 모델 없이 최적 정책을 찾는다. 왜 상태 가치가 아니라 행동 가치여야 하는가, 두 개의 문과 ε-탐욕과 GLIE, 바람 부는 격자의 Sarsa와 Sarsa(λ), 중요도 표본과 오프-폴리시, 벼랑 걷기로 보는 Q-러닝, 그리고 DP와 TD의 대응.