<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>강화학습 on 3rd layer</title><link>https://3rdlayer.uk/ko/tags/%EA%B0%95%ED%99%94%ED%95%99%EC%8A%B5/</link><description>Recent content in 강화학습 on 3rd layer</description><generator>Hugo -- 0.157.0</generator><language>ko-KR</language><lastBuildDate>Sat, 19 Jun 2021 00:00:00 +0000</lastBuildDate><atom:link href="https://3rdlayer.uk/ko/tags/%EA%B0%95%ED%99%94%ED%95%99%EC%8A%B5/index.xml" rel="self" type="application/rss+xml"/><item><title>강화학습 10강: 게임 속 강화학습</title><link>https://3rdlayer.uk/ko/posts/rl-10-games/</link><pubDate>Sat, 19 Jun 2021 00:00:00 +0000</pubDate><guid>https://3rdlayer.uk/ko/posts/rl-10-games/</guid><description>데이비드 실버 강의 10강. 사례 연구. 게임이론으로 본 최선 대응과 내시 균형, 미니맥스 탐색과 이진-선형 가치함수, 자기 대국 강화학습, 미니맥스와 강화학습의 결합, 그리고 포커 같은 불완전정보 게임. 치누크·딥블루·로지스텔로·TD-개먼·메이븐을 관통하는 하나의 레시피.</description></item><item><title>강화학습 9강: 탐험과 활용</title><link>https://3rdlayer.uk/ko/posts/rl-09-exploration-exploitation/</link><pubDate>Sat, 15 May 2021 00:00:00 +0000</pubDate><guid>https://3rdlayer.uk/ko/posts/rl-09-exploration-exploitation/</guid><description>데이비드 실버 강의 9강. 지금 아는 걸 써먹을까(활용), 더 알아볼까(탐험)? 이 딜레마를 다섯 원리로 묶고, 다중 슬롯머신에서 후회와 하한, UCB, 톰프슨 표집, 정보 상태 탐색까지, 그리고 문맥 밴딧과 MDP로의 확장을 따라간다.</description></item><item><title>강화학습 8강: 학습과 계획의 통합</title><link>https://3rdlayer.uk/ko/posts/rl-08-integrating-learning-planning/</link><pubDate>Sat, 17 Apr 2021 00:00:00 +0000</pubDate><guid>https://3rdlayer.uk/ko/posts/rl-08-integrating-learning-planning/</guid><description>데이비드 실버 강의 8강. 경험에서 환경 모델을 배우고 그 모델로 계획한다. 모델 학습은 지도학습, AB 예제, Dyna와 Dyna-Q+, 몬테카를로 트리 탐색과 바둑, TD 탐색과 Dyna-2.</description></item><item><title>강화학습 7강: 정책 경사</title><link>https://3rdlayer.uk/ko/posts/rl-07-policy-gradient/</link><pubDate>Sat, 13 Mar 2021 00:00:00 +0000</pubDate><guid>https://3rdlayer.uk/ko/posts/rl-07-policy-gradient/</guid><description>데이비드 실버 강의 7강. 가치를 거치지 않고 정책을 직접 최적화한다. 우도비 트릭과 스코어 함수, REINFORCE, 베이스라인과 이점, 액터-크리틱, 자연 정책 경사, 그리고 여섯 얼굴을 하나로 묶는 요약.</description></item><item><title>강화학습 6강: 가치함수 근사</title><link>https://3rdlayer.uk/ko/posts/rl-06-value-function-approximation/</link><pubDate>Sat, 13 Feb 2021 00:00:00 +0000</pubDate><guid>https://3rdlayer.uk/ko/posts/rl-06-value-function-approximation/</guid><description>데이비드 실버 강의 6강. 상태가 너무 많아 표로 다 못 적는 큰 문제를 파라미터 몇 개로 근사한다. 경사하강으로 특징을 학습하는 증분법, 마운틴 카와 부트스트랩 논쟁, 오프폴리시가 발산하는 베어드 반례, 그리고 경험을 모아 푸는 배치법과 DQN까지.</description></item><item><title>강화학습 5강: 모델 프리 제어</title><link>https://3rdlayer.uk/ko/posts/rl-05-model-free-control/</link><pubDate>Sat, 16 Jan 2021 00:00:00 +0000</pubDate><guid>https://3rdlayer.uk/ko/posts/rl-05-model-free-control/</guid><description>데이비드 실버 강의 5강. 모델 없이 최적 정책을 찾는다. 왜 상태 가치가 아니라 행동 가치여야 하는가, 두 개의 문과 ε-탐욕과 GLIE, 바람 부는 격자의 Sarsa와 Sarsa(λ), 중요도 표본과 오프-폴리시, 벼랑 걷기로 보는 Q-러닝, 그리고 DP와 TD의 대응.</description></item><item><title>강화학습 4강: 모델 프리 예측</title><link>https://3rdlayer.uk/ko/posts/rl-04-model-free-prediction/</link><pubDate>Sat, 12 Dec 2020 00:00:00 +0000</pubDate><guid>https://3rdlayer.uk/ko/posts/rl-04-model-free-prediction/</guid><description>데이비드 실버 강의 4강. 환경 모델 없이 경험만으로 정책의 가치를 추정한다. 블랙잭의 몬테카를로, 퇴근길의 시간차 학습, 부트스트랩과 샘플링의 통합 뷰, 그리고 적격 흔적의 TD(λ).</description></item><item><title>강화학습 3강: 동적 계획법</title><link>https://3rdlayer.uk/ko/posts/rl-03-dynamic-programming/</link><pubDate>Sat, 14 Nov 2020 00:00:00 +0000</pubDate><guid>https://3rdlayer.uk/ko/posts/rl-03-dynamic-programming/</guid><description>데이비드 실버 강의 3강. MDP를 완전히 아는 상황에서 벨만 방정식을 반복으로 풀어 최적 정책을 계산한다. 정책 평가·정책 반복·가치 반복을 작은 격자 세계 예제로.</description></item><item><title>강화학습 2강: 마르코프 결정 과정</title><link>https://3rdlayer.uk/ko/posts/rl-02-mdp/</link><pubDate>Sat, 17 Oct 2020 00:00:00 +0000</pubDate><guid>https://3rdlayer.uk/ko/posts/rl-02-mdp/</guid><description>데이비드 실버 강의 2강. 강화학습 문제를 담는 그릇인 MDP를, 마르코프 연쇄에서 보상 과정을 거쳐 결정 과정까지 실버의 &amp;lsquo;학생&amp;rsquo; 예제와 함께 한 층씩 쌓아 올린다.</description></item><item><title>강화학습 1강: 강화학습 문제</title><link>https://3rdlayer.uk/ko/posts/rl-01-introduction/</link><pubDate>Sat, 19 Sep 2020 00:00:00 +0000</pubDate><guid>https://3rdlayer.uk/ko/posts/rl-01-introduction/</guid><description>데이비드 실버 강의 1강. 강화학습이 다른 학습과 무엇이 다른지, 보상과 상태, 그리고 에이전트를 이루는 세 조각(정책·가치함수·모델)까지.</description></item><item><title>강화학습: 서튼 &amp; 바르토와 데이비드 실버 (무료 자료)</title><link>https://3rdlayer.uk/ko/posts/rl-resources/</link><pubDate>Sat, 05 Sep 2020 00:00:00 +0000</pubDate><guid>https://3rdlayer.uk/ko/posts/rl-resources/</guid><description>강화학습에 들어가는 가장 좋은 무료 두 갈래: 서튼과 바르토의 교과서(무료 PDF)와 데이비드 실버의 강의(무료 영상). 시리즈를 여는 김에 어디서 받는지 정리한다.</description></item></channel></rss>