-
A Circuit for Indirect Object Identification in GPT-2 SmallLLMs/Interpretability 2026. 6. 19. 17:01
https://arxiv.org/pdf/2211.00593
(ICLR 2023)
MI는 subfield가 방대하다.
top-down 전략으로 공부 中
survey paper로 전반적인 landscape를 파악하고,
각 subfield의 주요 논문을 나의 관심사와 관련 있는 부분을 위주로 빠르게 읽고 있다. (on-going)
좀더 꼼꼼히 읽으며 세부적인 내용을 파악하고, 어떻게 활용할 수 있을지 고민하는 건
앞으로의 과제이겠다.
(high-level에서는 고개를 끄덕끄덕하면서 보았지만, 세부적으로 들어가면 그렇게 단순하지 않다!)
MI는 broad하게 말하자면, model의 내부에서 우리가 원하는 어떤 algorithm을 설명할 수 있는 subgraph (computation graph의 일부)를 포착하는 것이 되겠다.
그런데 이때, 각각의 node와 graph가 의미하는 바가 조금씩 다르기 때문에 접근에 주의하여여 한다.
feature (concept)이 될 수도 있고, architecture의 component일 수도 있고, 특정 역할을 하는 causal variable에 해당하는 distributed representation이 될 수도 있다.
본 논문에서는,
logit으로부터 거슬러 올라가면서 중요한 역할을 하는 node를 찾아간다.search method는 path patching을 썼고, 여기서 node는 attention head에 해당한다.
'구체적으로 어떤 역할을 하는가?' 는 attention pattern analysis, projection on embedding matrix 등을 사용하였다. hypothesis를 세우고, 실험을 통해 검증하는 방식으로 circuit을 찾아간다.
여기서 중요한 점은, '이렇게 찾은 circuit이 유효한가?' 에 대한 검증이다.예전 글에도 쓴 적이 있지만,
"model 내부의 computation graph에서 추출해낸 circuit에 대한 해석이 타당한지 어떻게 증명할 것인가?" 가 중요하다고 생각하였는데,
본 논문에서는, 이 문제에 대해서 "명확한 기준을 제시하고 각 기준을 충족하는지 여부를 실험"을 통해 보여준다.
































'LLMs > Interpretability' 카테고리의 다른 글
[★circuit tracing tools★] what's going on inside LMs? (0) 2026.07.18 [★on-going★] Anthropic publications 정주행 (0) 2026.07.15 Finding Alignments Between Interpretable Causal Variables and Distributed Neural Representations (0) 2026.06.18 How to use and interpret activation patching (0) 2026.06.18 The Hydra Effect: Emergent Self-repair in LM Computations (0) 2026.06.18