安全、越獄與紅隊測試

安全微調(safety fine-tuning)

安全微調(safety fine-tuning)是教一個本已具備能力的模型「何時該說不」的訓練階段。原始的預訓練模型會樂於接續任何文字,包括一步步的傷害教學;安全微調調整它的權重,使它在面對界定好的有害類別請求時,改為產生拒絕。它用的是與其餘對齊相同的機制:優良拒絕的監督式範例,以及人類或 AI 評審偏好安全回覆的偏好資料,融入 RLHF、憲法式(constitutional)方法或直接偏好優化(DPO)之中。

目標是讓安全行為成為模型的預設傾向,而非一個脆弱的外掛,好讓它能推廣到沒人寫過規則的有害請求。這也正是它的核心難處:訓練涵蓋的是有限的攻擊集合,而重新措辭的空間是無窮的,所以安全微調能可靠擋下明顯案例,卻替新穎越獄留了空間。因此團隊會(常用自動化搜尋)挖掘對抗性提示,把最難的例子再餵回下一輪訓練。

有兩個副作用值得注意。第一,推得太用力,模型會過度拒絕,連無害請求都婉拒——這是實在的代價,有時稱為「對齊稅」(alignment tax)。第二,相對於能力,安全訓練是淺的:底層的危險知識原封未動,被改變的只是「分享它的傾向」,而少量的對抗性微調,即使用看似無害的資料,都可能把這層安全外殼剝掉。安全微調抬高了濫用的成本;它並沒有讓模型「沒有能力」造成傷害。

安全微調改變的是傾向,而非能力——這正是為什麼開放權重模型的安全,可能被區區幾百步的微調剝除。

又称
safety alignmentsafety training