模仿學習與逆向強化學習
逆向強化學習 vs. 模仿(inverse RL vs. imitation)
這是同一個問題的兩種答案:給定專家行為,你該學什麼?模仿學習(含行為複製)直接學行為——一個把狀態對應到動作的策略,複製的是「做什麼」。逆向強化學習則學解釋——一個捕捉「為什麼」的獎勵函數——再據此規劃或跑強化學習來行動。一個伸手去抓動作,另一個伸手去抓動作背後的目標。
取捨在於可移植性與直接性之間。複製出的策略簡單、不需要環境模型,但被綁死在它被示範的那個世界裡,且無法超越專家。還原出的獎勵較難取得且有歧義,卻能移轉:改變動力學、機器人身體或起始狀態,你都能重新最佳化同一個目標,甚至在該目標上超越示範者。
實務上界線會模糊。像 GAIL 這類對抗式方法在不指名獎勵的情況下模仿分布,AIRL 從同一場賽局萃取出可移轉的獎勵,而示範引導的強化學習則把模仿外掛到獎勵最佳化上——所以誠實的框架是一條從「複製動作」到「還原意圖」的光譜。
又称
另见