模仿學習與逆向強化學習

模仿學習(imitation learning)

模仿學習是用「示範」而非「獎勵」來教學。與其讓智能體在上百萬次嘗試中跌跌撞撞地摸索出有效做法,你直接給它一批專家示範——也就是熟練的人類或控制器把任務做得很好的紀錄——再要求它重現那個行為。學生看著駕訓教練在車流中操作方向盤,然後照著做,就是在做模仿學習。

具體來說,一段示範是一條狀態軌跡,通常還附上專家當下採取的動作。學習者擬合一個把狀態對應到動作的策略,方法可以是單純的監督式複製(行為複製),或是先還原專家隱藏的目標(逆向強化學習)。這繞過了標準強化學習的兩個難點:手工設計獎勵函數,以及安全地探索——這兩件事專家都已經替你隱含地解決了。

代價是你只學得到被示範過的東西。智能體並不理解專家「為什麼」這樣做,所以一遇到示範沒涵蓋的情境就可能嚴重出錯,而且除非額外加入獎勵訊號,它幾乎不會超越示範者。

又称
learning from demonstrationLfD