-
(2/3) A Primer on the Inner Workings of Transformer-based LMsLLMs/Interpretability 2026. 6. 13. 10:46
https://arxiv.org/pdf/2405.00208v3
(Oct 2024)
Mechanistic Interpretability 를 처음 접했을 때, 공부하는 게 쉽지 않았다.
주로 Antropic의 blog post와 youtube 영상들을 참고했는데, 이해하고 익숙해지는데 꽤 많은 시간이 소요되었다.
본 논문은 전반적인 내용을 잘 톭아준다.
강추이다.
특히, 수식과 figure를 꼼꼼히, 충분히 보면, 훨씬 접근이 수월하다.
다른 분들은 어떤 자료를 참고하시는지 궁금!
LLM의 내부 동작을 이해한다던지, steering한다던지 등의 Mechanistic Interpretability의 여러 중요한 application이 있겠지만,
사실 내가 Mechanistic Interpretability에 관심을 갖게 된 주요 이유는,
LLM이 causal reasoning을 할 수 있다는 증거라는 생각 때문이다.
이는 LLM을 통해서 '우리가 모르는 새로운 인과성을 규명한다거나, 새로운 과학적 사실을 근거있게 발견할 수 있지 않을까?' 하는 생각으로 이어졌다.
이런 나의 생각이 타당한 건지 잘 모르겠다.
이런 식의 연구가 이루어져 있는지도 잘 모르겠다.


















'LLMs > Interpretability' 카테고리의 다른 글