读论文
Wes Gurnee、Nicholas Sofroniew、Jack Lindsey 等 · Anthropic · Transformer Circuits Thread · 2026
Jacobian Lens 把模型中间层里可被语言化的表示读出来。真正的发现不是它们存在,而是它们只占激活方差的不到 10%,并且只支撑显式报告与灵活推理、不支撑自动化处理。
阅读原文 → #interpretability #LLM #mechanistic-interpretability