模仿學習與逆向強化學習
逆向強化學習中的獎勵歧義(reward ambiguity)
獎勵歧義是逆向強化學習最根本的頭痛問題:同一批示範可以被許多不同的獎勵函數同樣完美地解釋。最尷尬的是,全零獎勵會讓所有策略都最佳,所以它能無聊地配適任何行為。看著某人小心翼翼地開車,你分不出他是重視安全、討厭罰單,還是純粹享受平順的駕駛——單憑軌跡無法確定那個目標。
更精確地說,有幾種變換不會改動最佳策略:把獎勵乘上一個正常數、加上一個常數,以及以位能為基礎的塑形——亦即跨越一次轉移時加上任意函數的差值。任一獎勵連同它所有被塑形過的近親都導出完全相同的行為,因此沒有額外假設,示範永遠無法挑出唯一的那個。
這正是為何每個實用的逆向強化學習方法都加上一個打破平手的準則——最大熵、特徵期望匹配、邊際,或一個先驗。認清歧義也讓人放下過高期待:還原出的獎勵只是一個可信的解釋,而非專家真正的心思,應以它的移轉效果來驗證,而不是當成真理。
以位能為基礎的塑形正是「行為無法辨識出唯一獎勵」的精確原因:它處處改變獎勵,卻可證明保持最佳策略不變。
又稱
另見