可解釋性
可解釋性落差(the interpretability gap)
想像圖表上有兩條線往前競速。一條是 AI 系統正變得多有能力;另一條是我們究竟能多好地理解它們內部正在發生什麼。今天,能力那條線在衝刺,而理解那條線在散步。可解釋性落差就是這段距離的名字:可解釋性目前能解釋的,與我們要對強大模型做出有力安全保證所需要理解的,兩者之間的差距。
具體來說,這道落差表現為規模與利害關係的不相稱。現有方法能逆向工程小型或中型模型中的特定行為、萃取龐大的特徵字典、驗證孤立的電路——這些都是真正的進展。但安全理想上想要的是:可靠地讀出一個前沿模型的目標、證明它沒有暗藏欺騙的計畫,並且要忠實地、在完整規模上做到。在「我們解釋了一個歸納電路」與「我們能證明這個系統並非欺騙性失準」之間,橫著一段巨大、只被部分繪測過的距離,而疊加現象、模型本身的龐大,以及無所不在的解釋幻覺風險,都讓它更加嚴峻。
這道落差是每一項可解釋性主張誠實的背景,而人們從中得出不同的結論。樂觀者主張這個領域還年輕且正在加速,像稀疏自編碼器這樣的工具正快速縮小落差,可解釋性有可能成為安全的基石。懷疑者則擔心能力可能持續超前理解,我們想驗證的某些東西可能極難甚至不可能被讀出,因此我們不該把安全押在一台還沒造出來的顯微鏡上。這道落差究竟處於什麼位置、是否縮小得夠快,是真正有爭議的。
我們可以有把握地說「這個注意力頭會複製重複的模式」。但我們還無法說「這個模型沒有暗藏誤導其操作者的目標」。這兩種陳述之間的鴻溝,就是一句話版的可解釋性落差。
可解釋性落差:我們能解釋的,與安全所要求的,兩者之間的距離。
這道落差有多大、縮小得多快,都是有爭議的。應把可解釋性當作一個正在成熟、有前景、需與其他安全措施結合的工具,而不是一個已經解決的保證。
又稱
另見