對齊與人類回饋強化學習(RLHF)

KL 懲罰(對齊中的 KL penalty)

KL 懲罰是那條牽繩,讓對齊後的模型不會脫韁亂跑。當你優化模型去追逐獎勵,它可能找到古怪、退化的方式來拿高分——重複討好的詞句、染上奇怪的文風,或讓多樣性崩塌。KL 懲罰衡量新模型的輸出分布偏離可信參考(通常是微調後的起點模型)多遠,並依偏離程度加上對應的成本。

機制上,它以一個從獎勵中扣除、再乘上係數 beta 的項出現。小的 beta 讓模型自由移動、用力追逐獎勵,但有出軌的風險;大的 beta 讓它貼近參考、規矩聽話,代價是學得較少。調 beta 是 RLHF 的核心旋鈕之一,而同樣的錨定想法也直接內建在 DPO 這類損失裡。

它為什麼有效的更深層原因:參考模型編碼了大量流暢、合理的行為,貼著它能保住這份能力,同時讓獎勵溫和地重塑那些真正攸關對齊的部分。

\text{reward}(x,y) \;=\; r_\phi(x,y)\;-\;\beta\,\log\frac{\pi_\theta(y\mid x)}{\pi_{\text{ref}}(y\mid x)}

逐詞元的 KL 項從獎勵中扣除,懲罰策略偏離參考分布。

又称
KL regularizationreference anchoring