機器人學習

模仿學習

模仿學習,就是透過把正確的做法做給機器人看來教它,就像小孩學打蛋是看著父母做,而不是胡亂瞎試、直到把廚房弄得一團糟。你不讓機器人為了追逐獎勵而在無盡的試錯中跌跌撞撞,而是給它一段專家把任務做得很好的記錄——每一刻都配上專家當時選擇的動作——機器人再訓練自己的策略去複現這些選擇。給它看足夠多的好示例,它就學會像示範者那樣行動。

最大的好處是,它繞開了基於獎勵的學習中最難的兩個環節:你不必手工拼湊一個棘手的獎勵函數,機器人也不必摔上幾千次才發現什麼管用,因為專家早就知道了。它經典的軟肋在於,一個純粹的模仿者只認得別人給它看過的處境。一旦它飄到了專家從沒去過的地方——一個略微古怪的角度、一個它從未真正到過的位置——它就沒有示範可抄,於是小錯誤會像滾雪球一樣越滾越大。現代方法會摻入一點糾正或額外練習來對抗這一點,但模仿學習的核心,仍是那個簡單而強大的想法:照著例子學。

為了教機器人倒咖啡,人先扶著它的手臂順順當當地倒上幾次;之後機器人便能自己模仿那個動作。

照著好例子學,而不是一路撞著去換取獎勵。

行為克隆是模仿學習最簡單的形式——在每個狀態上直接照抄專家的動作。

又稱
learning by imitation模仿式学习模仿式學習