模仿學習與逆向強化學習

模仿中的共變量偏移(covariate shift)

共變量偏移是天真模仿會偏離正軌的原因。複製出的策略只在專家造訪過的狀態上受訓,但執行時卻是策略自己決定要去哪裡。一個微小誤差把它推進一個訓練時從沒見過、略微偏離分布的狀態;在那裡它又多錯一點,落到更陌生的地方,落差像滾雪球般擴大。想像一個照抄來的駕駛,原本能好好沿著車道行駛,直到一次小晃動讓車輪壓上路肩——而教練從沒示範過怎麼從那裡救回來。

傷害隨任務時程是二次成長而非線性:每步誤差率 epsilon,在 T 步內可使總成本以約 epsilon 乘上 T 平方的速度增長,因為每個早期失誤都製造出大量策略從未受訓過的後續狀態。這是行為複製在長時程控制上脆弱的核心理論原因。

各種修補方法都共享同一個想法:在策略「實際會造訪」的狀態上訓練它,而不只是專家的狀態。DAgger 的做法是在學習者自己跑出的軌跡上向專家查詢;像 GAIL 這類對抗式方法則改為匹配學習者的整個狀態分布與專家的分布,而不是逐點匹配動作。

共變量偏移是資料蒐集方式的性質,而非模型的性質——換更強的網路並不能消除它,改變訓練分布才行。

又稱
compounding errorsdistribution shift in BC