基於人類回饋的強化學習

純量回饋對比較回饋(scalar vs. comparative feedback)

請人類判斷行為,有兩種自然的方式。純量(絕對)回饋問的是「這個有多好,給個分數?」——每個項目一個評分。比較(相對)回饋問的是「這些之中哪個比較好?」——項目之間的一個排序。它們聽來可以互換,實務上的表現卻大不相同,而這個選擇,悄悄塑造了後續整條回饋流程。

純量評分資訊豐富——一個數字同時帶著方向與大小——但難以校準:評分者錨定的基準不同、在一場作業裡會漂移、也鮮少對「七分」是什麼有共識。比較丟掉了大小(你學到的是次序,而非差多少),卻可靠得多,因為相對判斷在認知上比絕對評分容易。這正是為什麼現代 RLHF 大量倚賴比較,再用像 Bradley-Terry 這樣的模型從中重建出純量獎勵。

兩者都不是絕對較好。比較需要很多對,才能釘出細緻的獎勵,而且沒有絕對零點;純量給出大小,卻要求小心的評分者校準。有些系統把兩者混用——用評分給粗略訊號、用比較分辨細微差別——而恰當的配比,全看你的標註者究竟能可靠地給你什麼,而非看理論上哪個優雅。

又称
absolute vs. relative feedback