從人類回饋學習——RLHF 與獎勵建模

基於 AI 回饋的強化學習(reinforcement learning from AI feedback, RLAIF)

人類偏好標註是 RLHF 的燃料,但人類慢、貴、又會累,而且永遠不夠用,尤其是要判斷棘手或敏感內容時。RLAIF 的提問是:如果讓一個有能力的 AI 來做大部分的比較呢?不再由人來挑兩個答案中較好的那個,而是讓另一個模型讀完兩者後,依照一段寫好的提示或一組原則做出判斷。這些由 AI 產生的偏好,接著就像人類標註一樣去訓練獎勵模型(或直接餵給某個偏好方法)。

具體而言,你給一個裁判模型一個清楚的指示,例如「選出更有用、且較不可能造成傷害的回應」,給它看兩個候選答案,再記下它的選擇。把這件事大規模地做,你就能用「算力」而非「人時」的代價,得到一份龐大的偏好資料集。這正是憲法式 AI 內部的引擎,其中的「原則」就是一部明文寫下的憲法。RLAIF 也可以和人類標註混用,AI 處理量大而容易的案例,人類處理困難或高風險的案例。

RLAIF 連結到一個更大的主題:可擴展監督。當模型處理的任務多到、或難到人類無法一一手動檢查時,我們會越來越依賴 AI 來幫忙監督 AI。它的承諾是更便宜、更一致、更可擴展的回饋。誠實的風險則是:裁判模型的錯誤、偏見與盲點,會被烤進獎勵訊號裡,因此 RLAIF 可能放大一個有缺陷模型的怪癖,而非加以矯正,而且它一樣逃不過古德哈特定律。經驗上,它在有用性與無害性上常能與人類回饋的 RLHF 打平,但它也繼承了裁判答錯的一切。

為了用低成本抑制有毒回覆,團隊讓一個裁判模型依照「偏好較友善、無毒的回應」這個指示去比較答案配對;它做出的數百萬個選擇,幾乎不需任何人類標註就訓練出一個獎勵模型。

RLAIF 用一個有能力模型的判斷,取代了大部分的人類比較。

RLAIF 並沒有移除人類判斷,而是把它搬進了裁判模型的指示、以及裁判模型本身;這個模型答錯的一切,都會被所有以它回饋訓練出來的東西所繼承。

又称
RLAIFAI feedback