對齊與人類回饋強化學習(RLHF)

對齊稅(alignment tax)

對齊稅,是你為了讓模型更安全、更守規矩,有時得交出去的能力。經過大量安全調校後,模型可能拒絕無害的邊界案例、在難題上損失一點原始正確率,或變得更謹慎、更囉嗦。基礎模型「本來做得到」與對齊後模型「願意去做」之間的落差,就是這筆稅。

這筆稅有些是真實的,有些是可避免的。被訓練成用生硬樣板拒絕的模型,會過度拒答、惹惱使用者;偏好資料過度獎勵謹慎的模型,會學會含糊其辭。更好的資料、更清楚的原則、更謹慎的目標函數能縮小這筆稅,而一個常見發現是:做得好的對齊可以幾乎免費,甚至提升有用性,因為「追隨意圖」本身就是一種能力。

這個說法的用處,在於提醒你兩邊都要量。悄悄掏空有用性的安全收益是壞交易,悄悄侵蝕安全的能力收益同樣是壞交易;目標是把前沿推到兩者兼得的地方。

又称
safety-capability trade-off