人工智慧安全與對齊

基於人工智慧回饋的強化學習(RLAIF)

RLAIF 就是把「基於人類回饋的強化學習」中的人類偏好標籤,換成由另一個 AI 評審產生的標籤。可以想像那條熟悉的流程:蒐集「哪個答案比較好」的比較,再由此訓練獎勵模型;只是現在這些比較來自一個被提示去依評分準則排序候選答案的能力模型,而非付費標註者。目的是在人類標註太慢、太貴或太令人不適而難以擴展時,讓對齊迴圈得以持續運轉。

在機制上,一個標註者模型看到兩個以上的回應和一份準則,輸出一個偏好,常以「哪個回應勝出」的機率表示;這些構成資料集,用常見的 Bradley-Terry 式損失訓練獎勵模型,之後再讓策略對該獎勵最佳化,通常用 PPO,或蒸餾成直接偏好目標。研究指出,在有用性與無害性上,RLAIF 可與 RLHF 相當或接近,而自我獎勵的變體更讓單一模型在迴圈中自行生成、評判並改進。

無法迴避的風險是,評審的盲點、校準偏差與偏見會被全盤繼承;而一個對著不完美 AI 獎勵猛力最佳化的策略,可能學會去討好那個評審,而非真正變好。因此 RLAIF 只是移動而非消除了人類瓶頸:人類如今必須驗證評審的偏好是否真的對齊他們實際想要的東西。

RLAIF 是引擎,憲法式 AI 只是規定「AI 評審該最佳化什麼」的一種配方;任何 AI 偏好來源都能拿來跑 RLAIF。

又称
RLAIFAI 回饋強化學習