Anthropic의 Transformer Circuits를 따라가는 시리즈.
기계적 해석가능성: 시작을 위한 무료 자료
학습된 신경망을 회로 단위로 역설계하기. Anthropic의 Transformer Circuits 스레드와 몇 가지 동반 자료가 전부 무료다. 이 시리즈를 여는 김에 어디서 시작할지 정리한다.
트랜스포머 회로 1: 결과 요약
Framework 논문 읽기 1편. 작은 어텐션 전용 모델을 모델 생물 삼아 트랜스포머를 완전히 역설계하려는 시도, 그리고 그 핵심 결과들의 지도.
트랜스포머 회로 2: 트랜스포머 다시 보기
Framework 논문 읽기 2편. 잔차 스트림을 통신 채널로, 어텐션 헤드를 독립적인 정보 이동 장치로 다시 그린다. 가상 가중치와 QK/OV 분해까지.
트랜스포머 회로 3: 0-레이어 트랜스포머
Framework 논문 읽기 3편. 어텐션이 하나도 없는 트랜스포머는 무엇을 배우는가. 답은 바이그램 통계, 그리고 이 답은 큰 모델의 직접 경로를 이해하는 열쇠가 된다.
트랜스포머 회로 4: 1-레이어 모델과 스킵 트라이그램
Framework 논문 읽기 4편. 어텐션 층 하나짜리 모델을 경로 전개로 완전히 펼친다. 스킵 트라이그램, 복사 헤드와 양의 고유값, 그리고 분해 구조가 낳는 특유의 버그까지.
트랜스포머 회로 5: 2-레이어 모델과 인덕션 헤드
Framework 논문 읽기 5편. 층이 둘이 되면 헤드가 헤드와 합성된다. Q-, K-, V-합성의 세 종류, 그리고 이 논문의 최대 발견인 인덕션 헤드의 작동 원리.
트랜스포머 회로 6: 남은 질문들
Framework 논문 읽기 6편. 이 프레임워크가 확보한 것과 확보하지 못한 것. MLP라는 벽, 그리고 이 논문이 예고하는 다음 연구들.
트랜스포머 회로 7: 관련 연구 지형
Framework 논문 읽기 마지막 편. 이 논문이 어떤 연구들의 어깨 위에 서 있는지, 그리고 기존 접근과 무엇이 다른지를 정리한다.