트랜스포머 회로 7: 관련 연구 지형
Framework 논문 읽기 마지막 편. 이 논문이 어떤 연구들의 어깨 위에 서 있는지, 그리고 기존 접근과 무엇이 다른지를 정리한다.
Framework 논문 읽기 마지막 편. 이 논문이 어떤 연구들의 어깨 위에 서 있는지, 그리고 기존 접근과 무엇이 다른지를 정리한다.
Framework 논문 읽기 6편. 이 프레임워크가 확보한 것과 확보하지 못한 것. MLP라는 벽, 그리고 이 논문이 예고하는 다음 연구들.
Framework 논문 읽기 5편. 층이 둘이 되면 헤드가 헤드와 합성된다. Q-, K-, V-합성의 세 종류, 그리고 이 논문의 최대 발견인 인덕션 헤드의 작동 원리.
Framework 논문 읽기 4편. 어텐션 층 하나짜리 모델을 경로 전개로 완전히 펼친다. 스킵 트라이그램, 복사 헤드와 양의 고유값, 그리고 분해 구조가 낳는 특유의 버그까지.
Framework 논문 읽기 3편. 어텐션이 하나도 없는 트랜스포머는 무엇을 배우는가. 답은 바이그램 통계, 그리고 이 답은 큰 모델의 직접 경로를 이해하는 열쇠가 된다.
Framework 논문 읽기 2편. 잔차 스트림을 통신 채널로, 어텐션 헤드를 독립적인 정보 이동 장치로 다시 그린다. 가상 가중치와 QK/OV 분해까지.
Framework 논문 읽기 1편. 작은 어텐션 전용 모델을 모델 생물 삼아 트랜스포머를 완전히 역설계하려는 시도, 그리고 그 핵심 결과들의 지도.
학습된 신경망을 회로 단위로 역설계하기. Anthropic의 Transformer Circuits 스레드와 몇 가지 동반 자료가 전부 무료다. 이 시리즈를 여는 김에 어디서 시작할지 정리한다.