機器人學習
機器人自監督學習
機器人自監督學習,是指機器人透過與世界互動,自己生成訓練所需的「答案」,而不必坐等人類一項項手工標註。其中的訣竅在於:物理動作會自動揭示一個結果——如果機器人試著去抓杯子,結果杯子真的落進了夾爪裡,那麼世界本身就已經把這次嘗試蓋章為「成功」,無需任何人開口說。機器人用動作給自己出題,現實則免費把答案遞回來。
這一點意義重大,因為手工標註正是機器人學習的一大瓶頸。用老辦法教機器人,意味著人們要費力地標出哪些抓取是好的、哪些路徑是安全的、哪個物體是什麼——既慢又貴,而且很快就標不動了。自監督則把機器人日常的笨手笨腳變成一本無窮無盡、自動標註好的練習冊:每一次戳、推、抓、邁步,都成了「這個動作會帶來什麼」的一個帶標籤樣本,全都在機器人不斷嘗試的過程中順手收集起來。機器人甚至能給自己發明有用的練習任務,比如預測自己移動之後會看到什麼,再拿去和實際看到的對照。
好處與陷阱是同一枚硬幣的兩面。正因為標籤是免費得來的,機器人可以收集到堆積如山的標籤、並不靠一支龐大的人工標註隊伍就持續進步——可這些標籤的誠實程度,完全取決於機器人用來給自己評判的那個信號。如果「成功」被定義得馬馬虎虎,機器人就會高高興興地學到錯誤的功課,精通一個誰也沒真正想要的目標。因此,設計出乾淨、可信的自我檢驗,才是機器人自監督學習真正的功夫所在。
把機器人獨自留在一箱雜物前,讓它玩一整夜,它會嘗試上千次隨機抓取;每當夾爪合攏,它就檢查自己有沒有提起東西,從而自動把每一次嘗試標註為成功或失敗,並靠這一夜的勞作學會抓取。
機器人給自己的作業打分:提起來了,還是沒提起來。
自監督學習依然用到「標籤」——只不過這些標籤是機器人自己從互動中產生的,而不是由人工標註員給出的。
又稱
另見