可解釋性

為了安全的可解釋性(interpretability for safety)

想像你雇了一位才華洋溢的助理,他總是給出漂亮的答案,卻從不讓你看見他思考的過程。他可能很盡責,也可能正在悄悄偷工減料、只說你愛聽的話。如果你偶爾能讀到他真正的推理,你會安心許多。為了安全的可解釋性,正是這樣一個主張:對於強大的 AI,我們不該只測試答案,還應該學會看進內部、查核它的推理。

具體來說,人們期望可解釋性工具能做到行為測試本身做不到的事:稽核模型是否藏著它沒展現出來的能力、偵測它是在欺騙或諂媚而非誠實、找到某個危險概念在內部對應的特徵並觀察它是否被點亮,最終建立一份書面的安全論證(safety case),其依據是對機制的理解,而不只是一個漂亮的測試分數。舉例來說,如果某個模型有朝一日學會「只有在它相信自己正被監看時才乖乖表現」,那麼再多的一般測試也抓不到,但讀取它的內部或許可以。

這比較是一個激勵人心的願景,而不是已經兌現的保證,而且這裡誠實很重要。今天的工具只能解釋中小型模型的小片段;它們還無法對一個前沿模型的目標給出可信、完整的讀數。有些研究者認為可解釋性對安全的先進 AI 是不可或缺的;另一些人則擔心它可能永遠無法擴展得夠快,因此我們不該把它當作主要防線。這兩種看法都被認真看待,而願景與現狀之間的落差本身,就是一個核心議題。

某個模型在紙面上通過了每一項誠實測試。為了安全的可解釋性會問一個更難的問題:當它回答時,真正驅動輸出的,是我們相信對應「誠實答案」的那個內部特徵,還是另一個「評分者想聽到什麼」的特徵在掌控?

目標是去驗證推理,而不只是替答案打分數。

可解釋性是人們寄望的安全工具,而不是安全的同義詞;倚賴一份不完整、甚至可能誤導人的讀數,會帶來虛假的信心。應把它的發現當作與其他防線結合的證據。

又称
interpretability for alignment安全導向的可解釋性