アーカイブ

0 分 · rick

ウリ・アロンのシステム生物学

ウリ・アロンのシステム生物学講義をたどるシリーズ。 ウリ・アロンのシステム生物学:無料の講義 2026-01-11 · 1 分 ウリ・アロンは生きた細胞を、技術者が回路を読むように読む。講義もノートも演習も、すべて無料だ。このシリーズを開くにあたり、入手先をまとめる。

rick

エッセイ

このブログのエッセイ集

rick

シリーズ

このブログの連載シリーズ

rick

について

ソウルでソフトウェア開発者として働いています。 ここは、学んだことや考えたことを、AIの助けを借りて投稿する場所です。

1 分 · rick

マッケイ: 情報理論

デビッド・マッケイ『情報理論、推論、学習アルゴリズム』を読み進めるシリーズ。 マッケイの情報理論:無料の教科書と講義 2025-01-04 · 1 分 デビッド・マッケイの名著は、情報理論・推論・機械学習を一つの物語に結ぶ。本も講義動画もすべて無料だ。このシリーズを開くにあたり、どこで入手できるかをまとめる。

rick

機械論的解釈可能性

AnthropicのTransformer Circuitsをたどるシリーズ。 機械論的解釈可能性:始めるための無料資料 2025-05-10 · 1 分 学習済みニューラルネットを回路単位で逆解析する。AnthropicのTransformer Circuitsスレッドといくつかの併走資料は、すべて無料だ。このシリーズを開くにあたり、どこから始めるかをまとめる。 トランスフォーマー回路 1: 結果の要約 2025-05-17 · 1 分 Framework論文を読む、第1回。小さなアテンション専用モデルをモデル生物として、トランスフォーマーを完全にリバースエンジニアリングする試み。その主要結果の地図。 トランスフォーマー回路 2: トランスフォーマーを描き直す 2025-05-31 · 1 分 Framework論文を読む、第2回。残差ストリームを通信チャネルとして、アテンションヘッドを独立した情報移動装置として描き直す。仮想重みとQK/OV分解まで。 トランスフォーマー回路 3: 0層トランスフォーマー 2025-06-14 · 1 分 Framework論文を読む、第3回。アテンションが一つもないトランスフォーマーは何を学ぶのか。答えはバイグラム統計。そしてこの答えは、大きなモデルの直接経路を理解する鍵になる。 トランスフォーマー回路 4: 1層モデルとスキップトライグラム 2025-06-28 · 1 分 Framework論文を読む、第4回。アテンション1層のモデルを経路展開で完全に開く。スキップトライグラム、コピーヘッドと正の固有値、そして分解構造が生む特有のバグまで。 トランスフォーマー回路 5: 2層モデルと誘導ヘッド 2025-07-12 · 1 分 Framework論文を読む、第5回。層が二つになるとヘッドがヘッドと合成される。Q-、K-、V-合成の三種類、そしてこの論文最大の発見である誘導ヘッドの仕組み。 トランスフォーマー回路 6: 残された問い 2025-07-26 · 1 分 Framework論文を読む、第6回。このフレームワークが確保したものと、できなかったもの。MLPという壁、そしてこの論文が予告する次の研究たち。 トランスフォーマー回路 7: 関連研究の地形 2025-08-09 · 1 分 ...

rick

強化学習

サットン&バルトの教科書から最新手法まで、デイビッド・シルバーの講義構成に沿って。 強化学習:サットン&バルトとデイビッド・シルバー(無料資料) 2020-09-05 · 1 分 強化学習に入る最良の無料ルート二つ:サットン&バルトの教科書(無料PDF)とデイビッド・シルバーの講義(無料動画)。このシリーズを開くにあたり、入手先をまとめる。 強化学習 第1講:強化学習問題 2020-09-19 · 1 分 デイビッド・シルバー講義の第1講。強化学習が他の学習と何が違うのか、報酬と状態、そしてエージェントを構成する三つの部品(方策・価値関数・モデル)まで。 強化学習 第2講:マルコフ決定過程 2020-10-17 · 2 分 デイビッド・シルバー講義の第2講。強化学習の問題を収める器であるMDPを、マルコフ連鎖から報酬過程を経て決定過程まで、シルバーの「学生」の例とともに一層ずつ積み上げる。 強化学習 第3講:動的計画法 2020-11-14 · 1 分 デイビッド・シルバー講義 第3講。MDPを完全に知っている状況で、ベルマン方程式を反復して解き、最適方策を計算する。方策評価・方策反復・価値反復を小さな格子世界の例で。 強化学習 第4講:モデルフリー予測 2020-12-12 · 1 分 デイビッド・シルバー講義第4講。環境モデルなしに、経験だけで方策の価値を推定する。ブラックジャックのモンテカルロ、帰り道の時間的差分学習、ブートストラップとサンプリングの統合ビュー、そして適格度トレースのTD(λ)。 強化学習 第5講:モデルフリー制御 2021-01-16 · 3 分 デイビッド・シルバー講義第5講。モデルなしで最適方策を見つける。なぜ状態価値ではなく行動価値なのか、二つの扉とε-貪欲とGLIE、風の吹く格子のSarsaとSarsa(λ)、重点サンプリングと方策オフ型、崖歩きで見るQ学習、そしてDPとTDの対応。 強化学習 第6講:価値関数近似 2021-02-13 · 2 分 デイビッド・シルバー講義第6講。状態が多すぎて表に書ききれない大きな問題を、わずかなパラメータで近似する。勾配降下で特徴を学ぶ増分法、マウンテンカーとブートストラップ論争、オフ方策が発散するBairdの反例、そして経験を集めて解くバッチ法とDQNまで。 強化学習 第7講:方策勾配 2021-03-13 · 1 分 デイビッド・シルバー講義第7講。価値を経由せず方策を直接最適化する。尤度比トリックとスコア関数、REINFORCE、ベースラインとアドバンテージ、actor-critic、自然方策勾配、そして六つの顔を一つにまとめる要約。 強化学習 第8講:学習と計画の統合 2021-04-17 · 1 分 デイビッド・シルバー講義第8講。経験から環境モデルを学び、そのモデルで計画する。モデル学習は教師あり学習、AB例、DynaとDyna-Q+、モンテカルロ木探索と囲碁、TD探索とDyna-2。 強化学習 第9講:探索と活用 2021-05-15 · 4 分 ...

rick