模仿學習與逆向強化學習
生成對抗模仿學習(generative adversarial imitation learning, GAIL)
GAIL 借用了生成對抗網路背後的把戲,並把它對準模仿。兩個網路在玩一場賽局:判別器試著分辨「狀態—動作」配對是來自專家還是學習者產生的,而策略則試著騙過它,讓自己的行為逼真到判別器分不出誰是誰。當策略獲勝時,它的行為在統計上就與專家的無從區分。
巧妙之處在於策略最佳化的對象。判別器的判決——某個動作看起來有多像專家——被當成獎勵回饋給策略,再用一般的強化學習去最大化它。因此 GAIL 從不明確地還原一個獎勵函數,也不逐點複製動作;它直接讓學習者的整個狀態—動作分布去匹配專家的分布,而這正是擊敗共變量偏移的關鍵。
結果是在專家示範的用量上很省、在長時程上很穩健,代價則是對抗式訓練一貫的不穩定,以及學習過程中需要與環境互動。
\min_{\pi}\max_{D}\ \mathbb{E}_{\pi}[\log D(s,a)] + \mathbb{E}_{\pi_{E}}[\log(1-D(s,a))] - \lambda H(\pi)
判別器 D 區分學習者與專家 π_E;策略最小化同一目標,並帶有熵獎勵 H(π)。
又稱
另見