模仿學習與逆向強化學習

最大熵逆向強化學習(maximum-entropy inverse RL)

最大熵逆向強化學習對歧義問題給出一個有原則的答案:在所有與示範一致的獎勵函數中,偏好那個能解釋示範、同時假設專家在資料允許範圍內盡可能隨機的獎勵。白話說,它把專家建模成「通常選高獎勵路徑、偶爾失手」,並拒絕從示範裡讀出比實際存在更多的結構。

形式上,它賦予每條軌跡一個正比於其總獎勵之指數的機率,於是較好的路徑機率呈指數倍高,但沒有任何路徑是不可能的。擬合獎勵於是變成最大似然問題:調整獎勵權重,使示範軌跡在此模型下盡可能機率最大——而這恰好也在期望意義上匹配了專家的特徵期望。

這套框架化解了困擾早期逆向強化學習的退化問題(它不會塌縮成全零獎勵),能優雅地處理有雜訊且次佳的專家,並成為現代深度與對抗式逆向強化學習方法的基礎。

P(\tau)\;\propto\;\exp\!\Big(\textstyle\sum_{t} r_{\theta}(s_t,a_t)\Big)

一條軌跡的機率隨其總獎勵呈指數上升——較好的路徑更可能,但沒有路徑是不可能的。

又称
MaxEnt IRL