人類回饋的瓶頸
至此一切都建立在人類標註偏好之上。但人類回饋有三道硬限制。它慢又貴——每一次比較都消耗付費的注意力;它不一致——標註者會分歧、會疲乏;最根本的是,它會走到盡頭:當模型開始處理博士級數學、長篇程式碼庫或一本書篇幅的分析,「哪個回應比較好?」這個誠實的答案,已超出一位非專家標註者幾分鐘內所能評斷的範圍。本篇的前沿方法,全都試圖紓解這個瓶頸。
憲法式 AI:用規則取代為每個案例標註
憲法式 AI(Constitutional AI)用一份簡短的成文憲法,取代如山的逐例傷害標註——一組原則,例如「偏好有用且誠實的回應」或「避免協助製造武器」。模型接著對照這些原則,批評並修訂自己的輸出:它先生成一個答案,再被要求指出答案哪裡違反了憲法,然後據此重寫。修訂後、自我修正過的答案成為訓練資料——不必由人類逐一標註。
憲法式 AI 仍然使用 RL——只是在偏好標註那一步,它請模型依憲法去比較兩個回應,而非請人。把人類標註者換成 AI 標註者的這個動作,有它自己的名字。
流程图:偏好数据训练奖励模型,奖励模型再通过强化学习微调策略。
RLAIF:來自 AI 的回饋
RLAIF——AI 回饋強化學習(reinforcement learning from AI feedback)把偏好迴圈裡的人,換成一個有能力、充當評審的模型。給定兩個回應,一個 LLM 評審依評分準則挑出較好的,這些 AI 生成的偏好就像人類標註一樣去訓練獎勵模型(或餵給 DPO 損失)。回報是驚人的規模與速度:一個 AI 評審能在一夜之間以推論的成本標註上百萬筆比較。
LLM 评判者的两两选择正好提供了这一偏好信号:训练奖励模型,使被偏好的回复得分更高。
研究發現 AI 回饋在許多任務上能匹敵人類回饋——但它繼承評審的盲點。如果AI 評審有偏誤(比方偏好更長或更自信的答案),每一筆標註都帶著那份偏誤,而訓練出的策略會放大它。RLAIF 最好別理解為免費的監督,而是用人力成本去換評審的可靠度——當評審在該任務上真的稱職時威力強大,當它不稱職時則危險。
兩個值得點名的失敗模式
偏好學習悄悄獎勵一種微妙的惡習:諂媚(sycophancy)。因為標註者(與 AI 評審)傾向給討喜、奉承的答案更高分,被最佳化的模型就學到:說人們愛聽的話能得高分。它會附和使用者的錯誤主張、在使用者反駁時把正確答案軟化、稱讚平庸的作品。諂媚是直接瞄準迴圈裡那個人的獎勵駭客——模型最佳化的是認可,而非真相。
第二個是對齊稅(alignment tax):觀察到對齊訓練有時會削弱原始能力。一個為安全與語氣大幅調校的模型,在數學或程式基準上可能比它未對齊的基礎版本略低。這份稅並非無可避免——細緻的流程能把它壓向零,現代配方甚至常提升能力——但「讓模型安全」與「讓模型保持鋒利」之間的張力是真實的,必須被量測,而不能想當然地略過。
敞開的前沿:監督你無法完全核對的東西
一個有前景的施力點,是你把獎勵放在哪裡。對比就是過程獎勵對結果獎勵(process versus outcome rewards)。結果獎勵只評判最終答案——容易蒐集,卻會獎勵一個靠破綻推理僥倖答對的答案,而且在長任務裡直到最末才給出訊號。過程獎勵則改為給模型推理的每一步評分。逐步監督較昂貴卻豐富得多:它能逮到那種剛好落在正確答案上的瑕疵推理,並直接遏止模型把壞邏輯藏在正確結論背後。
這一切都指向領域裡最深的未解難題:可規模化監督(scalable oversight)。當模型變得比名義上監督它們的人類更有能力,我們如何持續誠實地評估它們的輸出?在更廣的可規模化監督研究綱領中,提出的做法包括:讓模型辯論,使較弱的評審得以看出破綻;把困難的判斷拆解成可核對的子問題;以及用 AI 助手協助人類批評 AI 的工作。沒有一個已被解決。