이 글로 기계적 해석가능성 시리즈를 연다. 목표는 학습이 끝난 신경망을 열어 보고, 어떤 내부 부품들이 함께 답을 만드는지 밝혀내는 것이다. 자동차 정비사가 엔진을 부품과 연결 관계로 이해하듯 신경망을 역설계한다.
처음부터 논문의 수식을 모두 이해할 필요는 없다. 먼저 아래 자료로 “모델 안에도 반복해서 쓰이는 작은 회로가 있다”는 그림을 잡고, 이어지는 글에서 부품을 하나씩 익히면 된다. 시작에 필요한 자료는 전부 무료다.
핵심: Transformer Circuits
Anthropic의 해석가능성 팀은 연구를 Transformer Circuits 스레드로 공개한다. 무료이고 온라인이다.
- 스레드 홈: transformer-circuits.pub
- 기초가 되는 글: A Mathematical Framework for Transformer Circuits (2021), 이어서 Toy Models of Superposition과 Towards Monosemanticity.
직접 해보기
- Neel Nanda의 입문 가이드, 그의 TransformerLens 라이브러리, 그리고 “200 Concrete Open Problems in Mechanistic Interpretability”.
- ARENA, 기계적 해석가능성 장과 연습문제가 통째로 있는 무료 강의.
앞으로
여기서부터 시리즈는 스레드를 한 편씩 따라가며, 도움이 될 때는 작은 실험도 곁들인다.