最小のトランスフォーマーから始める。アテンション層が0個、埋め込みと逆埋め込みだけのモデルだ。

モデル全体が表一つ

このモデルがやることは、スマホの自動補完と全く同じだ。文脈は一切見えず、直前に出た単語一つだけを見て、次の単語を提案する。

数式ではこれで全部だ。

$$T = W_U W_E$$

トークンが入ってきたら埋め込み($W_E$)、すぐに逆埋め込みして($W_U$)次トークンのロジット、つまり次に来るトークン候補ごとに付ける点数を出す。位置も文脈もないので、各トークンは自分自身だけを見て次を予測しなければならない。

この条件で学べる最善は決まっている。「今のトークンがAのとき、次のトークンの分布」、つまりバイグラム統計だ。たとえば「Barack」を入れると、こんな点数表が出てくる。

Obama    とても高い
said     ふつう
banana   とても低い

語彙が5万個なら、$W_U W_E$ はこの 5万 x 5万 の表を低次元に圧縮した近似だ。実際に学習させた0層モデルを開いてみると、まさにこの種の統計が入っている。

なぜこのトイモデルが重要か

0層モデル自体はつまらない。このセクションの本当の使いどころは、大きなモデルを見るときに現れる。

層がいくら多くても、埋め込みから逆埋め込みへまっすぐ向かう直接経路(direct path) $W_U W_E$ は常に存在する。残差ストリームが線形の通路だからだ。そしてこの直接経路は、構造的に0層トランスフォーマーと全く同じだ。文脈は見えず、現在のトークンだけで次のトークンを押すことしかできない。

そこで自然な絵が出てくる。どんなに深いモデルの中にも自動補完が一つ内蔵されていて、その分担がバイグラムだ。ただし論文は言葉を慎重に選ぶ。他の経路もバイグラムの一部を一緒に予測するので、大きなモデルの直接経路が担うのはバイグラム全体ではなく、その残余だ。文法のような一般規則では説明できず、ただ覚えるしかない隣接関係、「Barack」の後の「Obama」のようなものがここに残る。モデルを経路の和として見ると、各経路が自分にできる仕事を分担する絵になる。

今回の要点

  • 0層トランスフォーマーは表一つ($W_U W_E$)だ。文脈なしの自動補完、つまりバイグラム統計がすべて。
  • 同じ形の直接経路はどんな深いモデルにも常に存在し、同じ分担を受け持つ。
  • 最小モデルの完全な理解が、大きなモデルの一部分の理解へそのまま移植される。モデル生物戦略の最初の成果だ。

次回は、アテンション層が一つ増えると何が変わるか。答えはスキップトライグラム(skip-trigram)だ。


原文: A Mathematical Framework for Transformer Circuits のZero-Layer Transformersセクション。