基於人類回饋的強化學習

憲法式回饋(constitutional feedback,RLAIF)

人類比較緩慢、昂貴又前後不一,還讓標註者暴露在不愉快的內容中。要是回饋改成來自一組寫下來的原則呢——一份簡短的「憲法」,列著像「偏好較無害的回應」這樣的規則——再由一個 AI 模型、而非人來施行?憲法式回饋做的正是這件事:訓練獎勵模型的那些比較,是由一個模型依明文原則評判輸出產生的,而非由人類替每一對標註。

拿憲法裡的一條原則去提示一個有能力的模型,問它兩個回應中哪個更符合該原則;它的選擇就成了偏好資料集,再透過慣常的 RLHF 機制,訓練出一個獎勵模型、接著一個策略——這套做法常被稱為基於 AI 回饋的強化學習(RLAIF)。人的工夫往上挪了一層:人們撰寫並修訂原則,而非替數千個個別比較標註,這讓價值變得明文、可稽核,且便宜到能規模化。

這拿人力換來了透明與規模,但回饋的好壞,頂多和原則與評判模型一樣好。兩者之中任一個的偏差與缺口,都會直接傳進策略,而模型也可能誤讀自己的規則、或施行不均。憲法式回饋並沒有把人類移出對齊——它只是把人類遷移了,從標註輸出,搬到撰寫並對憲法本身做壓力測試。

又称
RLAIFRL from AI feedback