この記事で機械論的解釈可能性のシリーズを始める。学習済みのニューラルネットを、人が理解できる回路へ逆解析しようとする試みだ。始めるのに必要なものは、すべて無料である。

中核:Transformer Circuits

Anthropicの解釈可能性チームは、研究をTransformer Circuitsスレッドとして公開している。無料でオンラインだ。

手を動かす

  • Neel Nandaの入門ガイド、彼のTransformerLensライブラリ、そして「200 Concrete Open Problems in Mechanistic Interpretability」。
  • ARENA、機械論的解釈可能性の章と演習がまるごとある無料講義。

これから

ここからシリーズは、スレッドを一編ずつたどり、役立つ場面では小さな実験も加えていく。