模仿學習與逆向強化學習

DAgger(資料集聚合,dataset aggregation)

DAgger 是治療共變量偏移的標準解方,想法妙在簡單:讓學習者開車,但把專家留在副駕座上隨時糾正。先用行為複製訓練一個初始策略,接著讓這個策略在環境中實際跑一遍,看看它究竟會去哪裡。在它造訪的每個狀態上,問專家「在這裡你會怎麼做」,把這些新的狀態—動作標籤加進資料集,重新訓練,再重複。

因為每一輪都恰好在學習者產生的狀態上蒐集標籤,訓練分布會逐漸收斂到策略自身造訪的分布——正是行為複製所忽略的那個不匹配。幾輪之後,聚合而成的資料集就涵蓋了學習者的錯誤以及如何從中救回,於是策略學會回到正軌,而不是越偏越遠。

代價是需要一位可即時查詢的互動式專家:你得有人或某個系統,能在學習者誤闖的任意狀態上標出正確動作。這在模擬中很便宜,但在真實世界面對人類老師時,可能既笨拙又不安全。

\mathcal{D}_{i+1}\leftarrow \mathcal{D}_i \cup \{(s,\pi^{*}(s)) : s\sim d_{\pi_i}\}

每一輪都在取自學習者自身狀態分布 d_{π_i} 的狀態 s 上,加入專家標籤 π*(s)。

又稱
DAgger