模仿學習與逆向強化學習

基於偏好的獎勵學習(preference-based reward learning)

基於偏好的獎勵學習,是從「比較」而非「示範」中推斷該獎勵什麼。與其要求一個人去執行任務——他可能根本做不到——你改為給他看智能體自己的兩段行為,問一個容易得多的問題:這兩個哪個比較好?從許多這類是非判斷中,擬合出一個獎勵模型,再用一般的強化學習去最佳化它。

標準模型把每次比較當成有雜訊的證據:真實獎勵較高的片段應該被選中的次數較多,這以一個 Bradley–Terry 似然來形式化——偏好某條軌跡的機率,隨兩者獎勵總和的差距而上升。擬合獎勵模型就是在蒐集到的偏好標籤上做最大似然,而整個迴圈在「對新行為蒐集比較」與「改進策略」之間交替進行。

這是語言模型 RLHF 的骨幹,也是那些「目標難以寫成程式、卻容易判斷好壞」之獎勵學習的骨幹。它的風險在於:學到的獎勵可能被策略鑽漏洞(獎勵駭客),而且它只反映你實際取樣到的那些比較與評判者。

P(\tau_1 \succ \tau_2)=\dfrac{\exp\!\big(\sum r(\tau_1)\big)}{\exp\!\big(\sum r(\tau_1)\big)+\exp\!\big(\sum r(\tau_2)\big)}

Bradley–Terry 模型:偏好軌跡 τ1 的機率,隨它相對 τ2 的獎勵優勢而上升。

又称
learning from preferencesRLHF reward modeling