鲁棒性与可解释性

机制可解释性(mechanistic interpretability)

/ mek-uh-NIS-tik in-TER-prit-uh-BIL-uh-tee /

机制可解释性,是试图像逆向一块电路板那样去逆向一个神经网络——逐个神经元、逐条连接地追踪那真正发生的计算,以找出模型学到的那个算法。别的可解释性方法问的是「哪些输入要紧?」,而这一种问的是更深的问题:「这个网络在里头到底在做什么,我们能不能把它写成一套可理解的机制?」

其梦想,是发现一团缠绕的权重,暗地里其实在实现某种叫得出名字的东西。比如,研究者已在视觉模型里找到专门检测曲线的特定神经元,也在语言模型里找到一小簇组件,它们合在一起执行一个可辨认的子程序——把前文提到过的一个名字复制过来,或是跟踪哪一个括号该闭合了。他们把这样一个被发现的、可复用的机制称为「回路」(circuit)。人们期望:复杂行为是由许许多多这样的回路搭起来的,而我们能把它们一一绘成图。

随着模型愈发能干、并被我们部署到高风险的岗位上,这件事愈发要紧。倘若我们真能理解一个模型的内部机制,就能核验它没有藏着一套欺骗性的策略、或一种危险的能力——这正是AI安全的一个核心目标。但诚实要求我们正视规模:机制可解释性已在小模型和孤立行为上做出了漂亮而严谨的成果,可要完整逆向一个拥有数十亿参数的前沿模型,仍远远超出当下的能力。它是这个领域里最有希望、也最是货真价实地艰难的前沿之一,而非一项你想跑就能跑的、已经解决了的诊断工具。

在小型Transformer里,研究者识别出了一种「归纳头」(induction head)——一对注意力组件,合在一起实现一条简单的规则:当你看到一个词元,就往回找它上一次出现的地方,再预测「当时它后面跟的是什么」。这是一个在权重内部找到的、真实而有名有姓的算法,它支撑起了模型「续接模式」这一能力的很大一部分。

一个「归纳头」:在Transformer权重内部发现的、一个货真价实的、习得的算法。

别把机制可解释性,与那些轻量工具(SHAP、显著性、注意力图)混为一谈。后者是从外部描述输入与输出之间的行为;机制可解释性则试图把内部的算法本身读出来。它的雄心远大得多——也远不如前者完整。那种「我们已能彻底『打开』如今最大的模型、并为其安全性背书」的说法,仍只是一种愿景。

又称
mech interpreverse-engineering neural networks机制可解释性機制可解釋性