對齊與人類回饋強化學習(RLHF)

RLHF 流程(RLHF pipeline)

RLHF(reinforcement learning from human feedback,人類回饋強化學習)是把原始語言模型變成好用助理的那套配方。它的直覺是「靠比較來教」:與其寫下完美答案,不如反覆給人看兩個模型回覆,讓他們說哪個比較好,再把模型推向人們一再偏好的那種答案。

經典流程分三階段。第一,監督式微調(supervised fine-tuning)用人類寫的優良示範來訓練模型。第二,人類比較成對的模型輸出,這些比較訓練出一個獎勵模型(reward model),它能替任何回覆打分,估計人會多偏好它。第三,用強化學習(通常是 PPO)優化模型,使它產生獎勵模型給高分的回覆,同時用 KL 懲罰項避免它偏離微調起點太遠。

每個階段都有各自的失敗方式:示範可能太狹隘、獎勵模型只是真實人類價值的代理(proxy),而 RL 步驟可能學會鑽這個代理的漏洞。RLHF 很強大卻也脆弱,這正是為什麼大量對齊研究都在設法讓這條鏈上的每一環更穩固。

\max_{\pi_\theta}\;\mathbb{E}_{x,\,y\sim\pi_\theta}\!\big[r_\phi(x,y)\big]\;-\;\beta\,\mathrm{KL}\!\big(\pi_\theta(\cdot\mid x)\,\Vert\,\pi_{\text{ref}}(\cdot\mid x)\big)

RL 階段最大化「獎勵模型分數」減去「把策略錨定在微調參考模型上的 KL 懲罰」。

又稱
reinforcement learning from human feedbackthe three-stage RLHF recipe