この記事で機械論的解釈可能性のシリーズを始める。学習済みのニューラルネットを、人が理解できる回路へ逆解析しようとする試みだ。始めるのに必要なものは、すべて無料である。
中核:Transformer Circuits
Anthropicの解釈可能性チームは、研究をTransformer Circuitsスレッドとして公開している。無料でオンラインだ。
- スレッドのホーム: transformer-circuits.pub
- 基礎となる論考: A Mathematical Framework for Transformer Circuits(2021)、続いてToy Models of SuperpositionとTowards Monosemanticity。
手を動かす
- Neel Nandaの入門ガイド、彼のTransformerLensライブラリ、そして「200 Concrete Open Problems in Mechanistic Interpretability」。
- ARENA、機械論的解釈可能性の章と演習がまるごとある無料講義。
これから
ここからシリーズは、スレッドを一編ずつたどり、役立つ場面では小さな実験も加えていく。