基於人類回饋的強化學習

對參考策略的 KL 懲罰(KL penalty to the reference policy)

一個剛預訓練好的模型,早已會寫出流暢、合理的文字。一旦你開始為了獎勵去最佳化它,就有真實的危險:它把這一切忘光,把自己扭曲成獎勵模型剛好給高分的任何怪輸出。KL 懲罰是一條牽繩:它衡量策略偏離原模型有多遠,並對偏離收取代價,把新行為錨定在舊有的能耐上。

在每一步,你都在獎勵上加一個懲罰,正比於目前策略與一個凍結參考之間的 Kullback-Leibler 散度——那個參考通常就是你出發時的監督微調模型。合起來的目標是「最大化獎勵,減去 β 乘上對參考的 KL」。β 大,策略就膽小、貼著參考;β 小,它就放膽追逐獎勵。在詞元層級的 RLHF 裡,這常常被直接折進逐詞元的獎勵中。

KL 懲罰是對抗獎勵過度最佳化的主要防線:它從實體上限制了策略能跑多遠去利用獎勵模型的盲點。但它是個鈍器。β 設得太強,模型幾乎不進步;太弱,它就駭進獎勵、退化成聽起來流暢的垃圾。調好這一個係數,是整套方法核心的平衡藝術之一。

\tilde r_t = r_\phi(x,y)\,[\,t=T\,]-\beta\,\log\frac{\pi_\theta(y_t\mid x,y_{<t})}{\pi_{\mathrm{ref}}(y_t\mid x,y_{<t})}

每個詞元的獎勵,是模型分數減去它對參考的 KL 偏移。

又稱
KL regularization to reference