機器人學習

世界模型

世界模型,是機器人學到的、關於自身環境如何運轉的一份內部副本——一個它隨身揣在腦子裡的私人小模擬器。給定當前的情形和它正在考慮的某個動作,世界模型會預測接下來很可能發生什麼:杯子會滑到哪裡、門會怎樣擺動、過一會兒攝影機又會看到什麼。它帶來的差別是:一台機器人究竟只能對眼前的東西作出反應,還是能在動手之前,悄悄地想像出每個選擇可能帶來的後果。

世界模型之所以強大,在於一旦學成,機器人就能在純粹的想像中把它反覆運行,比在現實中行動快得多、也便宜得多。它可以憑空設想出許多種可能的動作序列,在模型裡看清哪些會帶來好結果,然後才下決心採用那個最好的計畫——這一切都無需碰一下真實的物體,也不用磨損一台真實的馬達。這正是世界模型在機器人學習中如此被看重的原因:真實機器人的時間既慢、又貴、還有風險,而在一個好模型裡想像出來的時間幾乎是免費的。

麻煩在於,這個模型終究只是一種猜測,是由機器人經歷過的體驗拼湊而成的。在它見識豐富的地方,預測會很準;在它見得少的地方,它想像出的未來就會偏離現實,建立在這些搖搖晃晃的幻想之上的計畫,可能以出人意料的方式失敗。所以機器人必須不斷收集新鮮的經驗來修正自己的世界模型,而聰明的系統還會追蹤模型有多大把握——在它可靠的地方信任它,在它只是瞎猜的地方保持謹慎。

在去碰一疊積木之前,一台帶有世界模型的機器人會先在腦中想像幾種推法,預測哪一種會把塔推倒;然後它只執行模型認為安全的那一推。

先想像後果,再動手一次。

世界模型預測的是環境的「未來」;別把它和地圖(描述東西在哪裡)或策略(決定該做什麼)混為一談。

又稱
learned dynamics model学习到的动力学模型內部世界模型