AnthropicのTransformer Circuitsをたどるシリーズ。
機械論的解釈可能性:始めるための無料資料
学習済みニューラルネットを回路単位で逆解析する。AnthropicのTransformer Circuitsスレッドといくつかの併走資料は、すべて無料だ。このシリーズを開くにあたり、どこから始めるかをまとめる。
トランスフォーマー回路 1: 結果の要約
Framework論文を読む、第1回。小さなアテンション専用モデルをモデル生物として、トランスフォーマーを完全にリバースエンジニアリングする試み。その主要結果の地図。
トランスフォーマー回路 2: トランスフォーマーを描き直す
Framework論文を読む、第2回。残差ストリームを通信チャネルとして、アテンションヘッドを独立した情報移動装置として描き直す。仮想重みとQK/OV分解まで。
トランスフォーマー回路 3: 0層トランスフォーマー
Framework論文を読む、第3回。アテンションが一つもないトランスフォーマーは何を学ぶのか。答えはバイグラム統計。そしてこの答えは、大きなモデルの直接経路を理解する鍵になる。
トランスフォーマー回路 4: 1層モデルとスキップトライグラム
Framework論文を読む、第4回。アテンション1層のモデルを経路展開で完全に開く。スキップトライグラム、コピーヘッドと正の固有値、そして分解構造が生む特有のバグまで。
トランスフォーマー回路 5: 2層モデルと誘導ヘッド
Framework論文を読む、第5回。層が二つになるとヘッドがヘッドと合成される。Q-、K-、V-合成の三種類、そしてこの論文最大の発見である誘導ヘッドの仕組み。
トランスフォーマー回路 6: 残された問い
Framework論文を読む、第6回。このフレームワークが確保したものと、できなかったもの。MLPという壁、そしてこの論文が予告する次の研究たち。
トランスフォーマー回路 7: 関連研究の地形
Framework論文を読む、最終回。この論文が誰の肩の上に立っているのか、既存のアプローチと何が違うのかを整理する。