對齊與人類回饋強化學習(RLHF)

過程獎勵與結果獎勵(process vs outcome rewards)

當模型解一道多步驟問題時,你可以在兩個不同的地方給它獎勵。結果獎勵只看最終答案:對或錯,就這樣。過程獎勵則看推理的每一步,替每一步是否站得住腳打分。這個差別在數學、寫程式這類任務上最關鍵,因為你可能透過有瑕疵或僥倖的路徑抵達正確答案。

結果獎勵便宜又客觀,卻很粗:它會樂於強化一條「跌跌撞撞剛好答對」的錯誤推理,也對「失敗嘗試是在哪裡走偏的」毫無訊號。過程獎勵由過程獎勵模型(process reward model)替每一步打分而來,回饋更稠密、能抑制看似合理卻無效的推理——但標註昂貴得多,也可能被鑽成「只是看起來嚴謹」的推理。

這個取捨正位於訓練推理模型的核心。過程監督傾向產生更值得信任、可查核的推理,而結果監督則更容易擴大規模,許多系統會把兩者混用。

又称
PRM vs ORMstep-level vs answer-level reward