ARTICLE · 人工智能
条条电路通罗马:探索大模型机制可解释性的内蕴多样性
一语总结本文为 MLNLP 学术 Talk 预告,介绍多伦多大学陈熙关于大模型机制可解释性的报告:提出重叠感知的 sheaf 发现框架 OASR,揭示同一模型能力可由多组结构不同但功能等价的机制实现。
本文是 MLNLP 学术 Talk 的活动预告,介绍多伦多大学陈熙将于 2026 年 8 月 8 日分享的报告「条条电路通罗马:探索大模型机制可解释性的内蕴多样性」。文章先介绍第一项工作 DiscoGP 提出的 sheaf 发现框架,说明 sheaf 与一般 circuit 的差异在于要求计算子图在其余连接被零消融后仍能独立维持任务能力;随后重点介绍被 ICML 2026 接收的「All Circuits Lead to Rome」研究,该工作提出重叠感知的 sheaf 发现框架 OASR,在间接宾语识别、语法判断与代码注释等任务上发现同一模型内可稳定存在多组结构重叠度极低但功能等价的机制,IOI 任务中两组 100%准确率 sheaf 的边级交并比仅 4.1%。文章还讨论了这一多样性现象在多种电路发现方法中的普遍性,以及对机制可解释性与可信 AI 研究的意义。
- Sheaf 比 Circuit 更严格,要求在零消融后仍能独立维持任务能力。
与一般仅要求因果相关的计算子图不同,sheaf 还需在其余连接被移除或零消融后保持任务表现,是更精确的功能路径刻画。
- OASR 框架揭示同一模型能力可由多组结构不同但功能等价的机制实现。
研究通过重叠感知的机制发现,挑战一任务对应一内部机制的传统假设,在多个任务上稳定找到结构重叠度极低的替代机制。
- IOI 任务中两组 100% 准确率的 sheaf 边级交并比仅 4.1%,机制间结构重叠极低。
这组数据直观说明模型内部存在大量功能等价、路径差异显著的分布式机制,单一稀疏电路并非不可替代的唯一核心。
- 机制多样性在 DiscoGP、ACDC、EAP、Edge Pruning 等方法中普遍存在。
研究验证了多样性并非单一方法的偶然产物,提示电路发现得到的结果只是机制解释空间中的一个成员。
- 可解释性研究应从单一电路走向机制等价类与分布式机制视角。
理解机制的等价性、替代性、稳定性与适用边界,有助于更可靠地进行模型诊断、风险识别与行为干预。
条条电路通罗马:探索大模型机制可解释性的内蕴多样性
本文是 MLNLP 学术 Talk 的活动预告,介绍多伦多大学陈熙将于 2026 年 8 月 8 日分享的报告「条条电路通罗马:探索大模型机制可解释性的内蕴多样性」。文章先介绍第一项工作 DiscoGP 提出的 sheaf 发现框架,说明 sheaf 与一般 circuit 的差异在于要求计算子图在其余连接被零消融后仍能独立维持任务能力;随后重点介绍被 ICML 2026 接收的「All Circuits Lead to Rome」研究,该工作提出重叠感知的 sheaf 发现框架 OASR,在间接宾语识别、语法判断与代码注释等任务上发现同一模型内可稳定存在多组结构重叠度极低但功能等价的机制,IOI 任务中两组 100%准确率 sheaf 的边级交并比仅 4.1%。文章还讨论了这一多样性现象在多种电路发现方法中的普遍性,以及对机制可解释性与可信 AI 研究的意义。
文章金句
"随着发现的机制数量增加,不同机制的并集持续扩大,而它们的共同交集反而不断缩小。
"电路发现方法得到的并非某个任务唯一的真实机制,而更可能是一个由大量功能等价、部分冗余且可以相互替代的机制所构成的解释空间中的一个成员。
"更加精确的机制解释,不仅需要发现能够支撑模型行为的计算机制,更需要理解不同机制之间的等价性、替代性、稳定性及其适用边界。