JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

從回饋對齊:RLHF、憲法式 AI 與 RLAIF

實用的外部對齊工具箱:偏好學習如何運作、一部成文憲法如何取代臨時標註、AI 回饋如何擴展它,以及為何監督推理過程勝過監督最終答案。

一口氣講完偏好學習流程

現代的「從回饋對齊」有一個標準形狀。先從一個 監督微調(supervised fine-tuning, SFT)過的基底開始。蒐集比較資料——對一個提示,給兩個回應,標註哪個更好。擬合一個 獎勵模型(reward model),讓它對回應的評分符合那些比較(在成對資料上的 Bradley–Terry 模型)。然後用 RLHF(通常是 PPO)對著那個獎勵優化策略,並加上一個 KL 懲罰,把你拉在基底模型附近,免得你漂進那些獎勵模型恰巧給高分的胡言亂語。

一图看懂 RLHF 流程:人类偏好比较训练出奖励模型,再由它微调策略。

示意图:人类偏好比较输入奖励模型,奖励模型微调策略。

兩個實務上的真理立刻浮現。第一,獎勵模型就是整場比賽——你的策略頂多只能跟它所優化的對象一樣對齊。第二,KL 項不是細節;它是你唯一能防止對獎勵模型 獎勵入侵 的防線。優化得太用力,策略就會找到對抗性的高獎勵亂碼。這就是為什麼人們像盯油表一樣盯著 KL 預算。

\max_{\pi_\theta}\ \mathbb{E}_{x\sim\mathcal{D},\,y\sim\pi_\theta(\cdot\mid x)}\!\big[r_\phi(x,y)\big]\;-\;\beta\,\mathrm{D}_{\mathrm{KL}}\!\big(\pi_\theta(y\mid x)\,\|\,\pi_{\mathrm{ref}}(y\mid x)\big)

带 KL 正则的 RLHF 目标:最大化奖励模型得分,同时用 β 加权的 KL 项把策略拴在参考模型附近。

人類標註用罄之處

人類偏好資料昂貴、緩慢、不一致,而且關鍵的是——它編碼了標註者剛好注意到的任何東西。標註者會獎勵聽起來自信、格式漂亮的答案,而這恰恰是訓練出諂媚與自信幻覺的方法。對於標註者並非專家的任何主題,那個「偏好」有一部分就是雜訊。當任務變得比中位數標註者更難時,訊號就朝著 可擴展監督 的前沿退化。

對這道擴展之牆的兩種回應,定義了本篇其餘的內容。其一:用模型自己的判斷取代大部分人類標註,並錨定在一組明確的原則上——這就是憲法式 AI 與 RLAIF。其二:別再只標註最終答案,而開始標註推理過程,讓錯誤無處藏身——這就是過程監督。

憲法式 AI:以原則取代逐案標註

憲法式 AI(Constitutional AI)把「你這個人類比較喜歡這兩個答案中的哪一個?」這個問題,換成「哪個答案更符合這條成文原則?」——並讓模型自己去套用原則。它分兩階段。在監督階段,模型對照憲法規則批評並修訂自己的回應(「那有害嗎?把它改寫成既無害又仍有幫助」)。在 RL 階段,模型透過對照憲法評判成對回應來產生偏好標註,然後你在那些標註上訓練獎勵模型。

概念上的勝利在於:對齊的標靶變成一份簡短、可稽核的文件,而不是一堆黑箱的群眾標註。你可以讀憲法、爭論某一條款、編輯它,再重新推導出行為——這是規格透明度的巨大改善。代價是要誠實面對一個微妙的轉移:你把信任從「人類評判了每個案例」移到了「模型正確地套用人類寫下的原則」。這只在模型有足夠能力且足夠誠實、能忠實套用原則時才成立。

# Constitutional AI, supervised stage (sketch)
for prompt in prompts:
    answer   = model(prompt)
    critique = model(f"Critique this answer per principle P: {answer}")
    revised  = model(f"Rewrite to fix the critique: {answer} | {critique}")
    sft_data.append((prompt, revised))   # train on the self-revised answers
模型對照一條明確原則來監督自己;人類稽核的是原則,而非每一筆輸出。

RLAIF 與過程監督

RLAIF(reinforcement learning from AI feedback,從 AI 回饋的強化學習)是它的推廣:凡是 RLHF 想要人類標註的地方,改去問一個有能力的模型,並提示它套用你的準則。它幾乎免費地擴展偏好資料,而且出乎意料地常常在有幫助性與無害性上追平甚至勝過人類回饋的基準。但誠實的警語是真實存在的——AI 標註者帶進自己的偏誤、可能被它所監督的策略鑽營,並有讓模型對著自己的偏好訓練的回饋迴圈風險。RLAIF 買到的是規模,不是真值

RLAIF 沿用同样的智能体—环境强化学习回路,只是把人类奖励信号换成按你的标准评判的 AI 评审。

强化学习回路:智能体作用于环境并获得奖励。

過程監督(process supervision)從不同角度攻擊同一道牆。你不再只獎勵最終答案(結果監督),而是獎勵推理中每一個正確的步驟。對多步驟的數學與程式碼,這顯著更好:一個標出第一個錯誤步驟的過程獎勵模型,提供了密集、有針對性的訊號,並拒絕替「對答案、錯推理」給分。它也更能抵抗 獎勵入侵——偽造一整條完全有效的推理鏈,比湊巧矇到一個正確的最終 token 困難得多。