學習範式
模仿學習(imitation learning)
/ im-ih-TAY-shun LER-ning /
教一個人開車,最快的辦法不是一本規則手冊——而是讓他坐在一位老司機旁邊,看老司機在每種情形下怎麼做,照著學。模仿學習給機器抄的正是這條近路:與其讓系統在無盡的試錯中自行摸索出好的行為,不如把專家做這件事的錄影給它,訓練它去模仿。
每一段示範,都是一串「情形」以及專家在其中所採取的「動作」。最簡單的形式叫行為克隆,它把這當成普通的監督學習:情形是輸入,專家的動作是正確標籤,模型學著把前者映射到後者。這繞開了強化學習裡最難的那部分——設計獎勵訊號、並安全地探索——這也正是模仿學習在機器人和自動駕駛裡受歡迎的原因,因為在真實世界裡隨機試錯,要麼危險,要麼慢得不可能。
它最大的弱點,是一個滾雪球式的難題。模型只見過專家到過的那些情形;而專家既然高明,就很少陷入麻煩。於是模型頭一回犯個小錯、漂進一個陌生的狀態時,它沒有可照抄的示範,便做出更糟的選擇,漂得更遠,錯誤層層累加。補救之法是有的——讓專家在模型實際到達的狀態裡去糾正它,或者摻進強化學習——但純粹的模仿,其上限也終究不會高過那位示範者,而且它會不聲不響地把專家的好習慣和壞習慣一併學去。
為了教一隻機械臂倒咖啡,一個人手把手地帶著它做這套動作幾十遍,系統則記錄下每一個關節的位置與移動。機械臂隨後學會復現這套倒法。可一旦它稍微過了頭、進入某個示範從未覆蓋的姿態,它就可能手忙腳亂——因為它只會照抄,卻不懂如何挽回。
照抄專家——可對專家從未到過的狀態,它沒有劇本。
純粹的模仿,上限不會高過示範者,連他的壞習慣也一併學去。它的典型失敗是誤差累積:一個小錯把它帶進一個沒有示範可抄的陌生狀態,於是越滾越糟。
又稱
另見