模仿學習與逆向強化學習
對抗式逆向強化學習(adversarial inverse RL, AIRL)
AIRL 保留了 GAIL 的對抗賽局,卻補上了 GAIL 丟掉的東西:獎勵函數。GAIL 學到的判別器在策略訓練完後就被丟棄——你得到一個好的模仿者,卻沒有可移植的目標。AIRL 則把判別器設計成能從中萃取出一個有意義、可重用的獎勵,還原的是「為什麼」,而不只是「做什麼」。
它的做法是把判別器參數化成一種特殊形式:它判斷一個動作時,是拿一個可學習的獎勵項去和策略自己採取該動作的機率相比。因為獎勵項固定地嵌在算式裡,訓練判別器去辨認專家的同時,也就擬合出一個獎勵函數。再加上一個塑形項,AIRL 甚至能還原出一個與環境動力學解耦的獎勵,因而可移轉到新的動力學。
這份可移轉性正是獎賞所在:機器人可以在不同身體或地形下重新學會同一個目標,而被綁死在訓練環境裡的 GAIL 模仿者做不到這件事。
D_{\theta}(s,a)=\dfrac{\exp\!\big(f_{\theta}(s,a)\big)}{\exp\!\big(f_{\theta}(s,a)\big)+\pi(a\mid s)}
AIRL 的判別器拿可學習的獎勵項 f_θ 與策略的動作機率相比;f_θ 即成為還原出的獎勵。
又称
另见