-
그간의 생각 정리, 근데 너무 어려움LLMs/Interpretability 2026. 7. 26. 17:50
그간 읽었던 paper들을 다시 읽으면서 summarize하고,
survey paper와 survey github를 뒤져서 관련 논문 더 읽고
생각을 정리해서
GPT 5.6 sol과 함께 discussion을 통해 research proposal을 작성하였다.
음..
근데.. 너무 어렵다. ㅠㅠ

역시 뭐든 high-level에서는 가능할 것 같지만,
세부적으로 들어가면 어려움.
이번주는 다른 논문이 아니라, 내 proposal을 뜯어보면서, 이게 가능할지 구상을 해야겠다.

집에서는 proposal 보면서 구상하고, 회사에서는 Neuronpedia interface에 적응해야겠다.
이번주는 회사에서 짬짬히 시간날때마다 circuit-tracer에서 attribution graph 만드는 거 해 볼 생각이다.
너무 어렵다.
대체 feature를 어떻게 labeling한 건지.. ㅎㅎ
주어진 attribution graph 해석하는 것도 쉽지 않은데,
prompting 하나 주고, graph 만들어보라고 하면 막막할 듯.
일단 해봐야지 ㅎㅎ

'LLMs > Interpretability' 카테고리의 다른 글
빠른 포기 & 공부 그만 (0) 2026.07.27 Pygmalion Effect - LLM의 identity 형성 (0) 2026.07.20 thought (0) 2026.07.20 Thought on Mechanistic interpretability (0) 2026.07.19 A global workspace in language models (0) 2026.07.18