トランスフォーマー回路 3: 0層トランスフォーマー
Framework論文を読む、第3回。アテンションが一つもないトランスフォーマーは何を学ぶのか。答えはバイグラム統計。そしてこの答えは、大きなモデルの直接経路を理解する鍵になる。
Framework論文を読む、第3回。アテンションが一つもないトランスフォーマーは何を学ぶのか。答えはバイグラム統計。そしてこの答えは、大きなモデルの直接経路を理解する鍵になる。
Framework論文を読む、第2回。残差ストリームを通信チャネルとして、アテンションヘッドを独立した情報移動装置として描き直す。仮想重みとQK/OV分解まで。
Framework論文を読む、第1回。小さなアテンション専用モデルをモデル生物として、トランスフォーマーを完全にリバースエンジニアリングする試み。その主要結果の地図。
学習済みニューラルネットを回路単位で逆解析する。AnthropicのTransformer Circuitsスレッドといくつかの併走資料は、すべて無料だ。このシリーズを開くにあたり、どこから始めるかをまとめる。
OpenAIのPretrained SAEでGPT-2内部の感情Featureを発見し、SAEをゼロから学習するまで。Feature Patchingで’good person’を’shit’に変える実験。
デビッド・マッケイの名著は、情報理論・推論・機械学習を一つの物語に結ぶ。本も講義動画もすべて無料だ。このシリーズを開くにあたり、どこで入手できるかをまとめる。
K-meansは実はGMMの極端なケースであり、GMMはEMアルゴリズムの代表的な応用である。三つがどのように一つのフレームワークで繋がるのか、そして情報幾何学がこの関係をどう説明するのかを直感的に解説する。
デイビッド・シルバー講義 第10講。ケーススタディ。ゲーム理論から見た最適応答とナッシュ均衡、ミニマックス探索と二値線形価値関数、自己対戦強化学習、ミニマックスと強化学習の結合、そしてポーカーのような不完全情報ゲーム。Chinook・ディープブルー・Logistello・TD-Gammon・Mavenを貫く一つのレシピ。
デイビッド・シルバー講義第9講。いま知っていることを使うか(活用)、もっと調べるか(探索)?このジレンマを五つの原理にまとめ、多腕バンディットにおけるリグレットと下界、UCB、トンプソンサンプリング、情報状態探索、そして文脈付きバンディットとMDPへの拡張までをたどる。
デイビッド・シルバー講義第8講。経験から環境モデルを学び、そのモデルで計画する。モデル学習は教師あり学習、AB例、DynaとDyna-Q+、モンテカルロ木探索と囲碁、TD探索とDyna-2。