安全、越獄與紅隊測試
拒絕行為(refusal behavior)
拒絕(refusal)就是模型那句「我無法協助這件事」的回應:一次刻意的婉拒,通常附上簡短理由,有時還給個比較安全的替代方案。它是安全訓練最外顯的表面。模型主要透過在示範與偏好上微調,被形塑成能辨認某些傷害類別的請求,並以婉拒、而非完成來回應。做得好,拒絕會具體而尊重;做得差,就成了說教式、罐頭般的訓話,惹惱了正當的使用者。
校準拒絕之所以真的很難,是因為兩個方向都有代價。太容易拒絕,就會「過度拒絕」(over-refusal):模型回絕一道化學作業題、一位資安從業者的正當請求、或只是提到敏感主題的小說,侵蝕了有用性與信任。太少拒絕,就會「拒絕不足」(under-refusal):它幫了那種真的該被擋下的罕見請求。模型必須僅憑文字判斷意圖與脈絡,而那正是連講道理的人都會各執一詞的模糊爭議地帶。
拒絕本身也是一個研究對象。可解釋性(interpretability)的研究發現,模型「拒不拒絕」可能對應到一個出奇簡單的內部方向(direction),這既解釋了為什麼一個小小的對抗性推力就能把拒絕翻成照辦,也指向更穩健的控制方式。更深的啟示是:拒絕反映的是「被訓練出的行為」,而非「知識的缺席」——模型其實仍知道那個它婉拒給出的答案。
過度拒絕與拒絕不足是同一個旋鈕的兩面;你無法把其中一邊壓到零而不抬高另一邊,所以問題永遠是:這個產品能容忍哪一種錯誤。
又称
另见