對齊與人類回饋強化學習(RLHF)
RLAIF(AI 回饋強化學習)
RLAIF 把 RLHF 裡的人類標註者換成 AI 標註者。與其付錢請人比較每一組成對回覆,不如請一個有能力的模型(通常由書面評分準則或憲法引導)判斷哪個回覆比較好,再用這些 AI 生成的偏好來訓練。流程其餘部分——獎勵模型與策略優化——維持不變。
動機是成本與覆蓋面。人類偏好資料又慢又貴,對敏感或專門內容更難蒐集,而 AI 評審能便宜又一致地標出數百萬筆比較。研究發現,在若干對齊任務上,AI 回饋能與人類回饋打平,尤其當評審模型夠強、評分準則夠清楚時。
明顯的隱憂是循環性:如果模型替自己這一類打分,它的盲點與偏誤可能被放大而非修正,評分準則裡的任何瑕疵也會悄悄擴散。RLAIF 最適合當成人類監督之上的力量倍增器——由人類訂定並稽核原則、AI 負責大量標註——而不是完全取代人類判斷。
又称
另见