模仿學習與逆向強化學習
行為複製(behavioral cloning)
行為複製是最直接的模仿方式:把示範當成一份有標籤的資料集,用一般的監督式學習去學「狀態到動作」的對應。專家造訪過的每個狀態是輸入,專家所選的動作是標籤;訓練一個分類器或回歸器去預測專家的動作,你就得到一個策略——不用獎勵、不用與環境互動、也不用探索。
訓練目標很單純,就是讓策略賦予專家動作的機率最大化,等價於在示範集上最小化預測損失。因為它本質上就是監督式學習,所以快速、穩定、容易實作,這也使它成為任何模仿問題的首選起手式與強力基準線。
它的致命弱點在於假設智能體永遠只會看到來自專家自身分布的狀態。一旦複製出的策略犯下一個小錯,就會落入陌生狀態,錯誤接著層層累積——這正是 DAgger 被發明出來要修補的共變量偏移問題。
\min_{\theta}\ \mathbb{E}_{(s,a)\sim\mathcal{D}}\big[-\log \pi_{\theta}(a\mid s)\big]
在示範集 D 上,最大化專家在狀態 s 採取動作 a 的對數似然。
又称
另见