人工智慧安全與對齊
過程監督(process supervision)
過程監督訓練並獎勵模型「每一個推理步驟的品質」,而非只看最終答案對不對。與之對照的是結果監督,它只在最後給一個獎勵,對答案如何得出毫不在意。其直覺是:靠著有瑕疵或僥倖的推理得到的正確答案既脆弱又難以信任,所以一步一步地檢查過程,能同時帶來更高的準確率,與更透明、可驗證的推理。
實務上,思路鏈的每一步會被標為正確、中性或錯誤,再訓練一個過程獎勵模型去為步驟評分;該模型接著監督生成——透過對抽樣解重新排序、在每一步給獎勵,或引導搜尋。在困難的數學基準上,以步驟級人類標籤訓練的過程獎勵模型,在挑選正確解上勝過結果獎勵模型,而且能精確定位推理最早在哪裡出錯。
就安全而言,其吸引力在於對齊的是推理過程而不只是答案:獎勵忠實的中間步驟,能抑制那種鑽結果空子的獎勵駭客,並產生監督者可稽核、更易讀的軌跡,這是可擴展監督的一種具體形式。代價則是繁重的步驟級標註、過程模型本身可能被鑽空子的風險,以及一個未解的問題:可見的思路鏈是否如實反映了模型實際的運算。
步驟級獎勵能改善結果與可稽核性,但易讀的思路鏈不保證是底層運算的忠實紀錄。
又稱
另見