基於人類回饋的強化學習
過程獎勵模型(process reward models, PRM)
當智能體解一個長問題時——多步驟的證明、一連串推理——你可以用兩種方式獎勵它。結果監督只檢查最終答案:對或錯。過程監督則沿途替每一步工作評分。過程獎勵模型就是被訓練來替那些中間步驟評分的,它告訴智能體的,不只是它成不成功,而是它的推理究竟在哪裡對了、又在哪裡錯了。
過程獎勵模型在「個別推理步驟為正確、有幫助或有瑕疵」的標註(人類產生或模型產生)上訓練,並在每一步、而非只在結尾發出獎勵。這給出一個稠密、定位良好的學習訊號:功勞落在真正掙得它的那一步上,而不是把一個粗略獎勵塗抹在整份解答上。它也勸阻一種惡名昭彰的失靈——靠錯誤推理抵達正確的最終答案,而只看結果的獎勵會樂於去強化這種事。
過程監督往往比結果監督產生更可靠、也更可解讀的推理,已成為訓練推理模型的一個領先方向。它誠實的代價是:步驟層級的標註蒐集起來貴得多,而要決定一個中間步驟怎樣才算「好」,本身就既微妙又有爭議。它端端正正地坐在獎勵設計,與功勞分配這個老問題的交會處。
又称
另见