從人類回饋學習——RLHF 與獎勵建模

RL 微調(RL fine-tuning)

一個已經學會語言、也被教會照指令做事的模型,能幹卻還不夠精緻,就像一個懂這份工作、卻還不熟「公司風格」的新人。RL 微調就是把它磨亮的指導階段:不是拿正確答案給模型模仿,而是讓它產生自己的答案、替答案打分,再調整它,使高分答案更可能出現。它就是 RLHF 裡的那個「RL」,是獎勵模型的分數真正被轉化成模型變化的階段。

在這個情境下的機制如下。語言模型被當成一個策略:給定一個提示,產出每一個字都是一個動作,而一個完成的答案會從獎勵模型得到一個獎勵。接著由一個強化學習演算法,最常見的是 PPO(近端策略優化),更新模型權重以提高期望獎勵,策略梯度本身的機械原理屬於強化學習領域,請交叉參照該領域,這裡不重新推導。關鍵在於,會加上一個 KL 散度懲罰,使策略無法偏離原始基礎模型太遠,藉此保持文字流暢、並抵抗獎勵入侵。

RL 微調正是賦予現代助理那種招牌般「有用、格式整齊」行為的東西,但它誠實的限制,恰恰就是整個 RLHF 的限制。因為它優化的是一個代理獎勵,它容易發生獎勵過度優化與獎勵入侵,而 KL 懲罰只是把它圍堵住;而且它塑造的是模型的外在行為,而非把真正的目標「裝」進去。它也不是唯一選擇,更簡單的替代方案如直接偏好優化(沒有明確的 RL 迴圈)與 best-of-n 取樣(完全不更新權重),都用不同手段瞄準同一組偏好。

在 RL 微調過程中,模型擬出一個答案,獎勵模型給它打 0.7 分,PPO 微調權重,使下一次導向那個 0.7 答案的選字稍微更可能出現,同時 KL 懲罰阻止風格漂移。

RL 微調把獎勵分數轉成權重更新,並繫上一條 KL 牽繩。

RL 微調優化的是代理獎勵、塑造的是行為而非目標,因此它繼承了獎勵過度優化與獎勵入侵;策略梯度的細節(如 PPO)屬於強化學習領域。

又称
RLFTthe RL steppolicy optimization step強化學習微調