機器人學習

控制策略

控制策略,就是機器人在每一刻用來決定該做什麼的那套規則。把機器人此刻對自己和世界的了解餵給它——比如各個關節的角度、攝影機看到的畫面、自己移動得有多快——策略就會回給它一個動作:轉這個馬達、邁這一步、把這個夾爪合上。你可以把它想像成機器人的本能,或者一種「看到這個、就做那個」的習慣。機器人學習的全部意義,就在於讓機器人從資料和經驗中長出一套好的策略,而不是靠人一條一條地手寫出每一個「如果……就……」的規則。

策略分為兩類。確定性策略是一份嚴格的食譜:同樣的處境永遠產生完全相同的動作,就像一台恆溫器,每次都在分毫不差的同一溫度把暖氣打開。隨機性策略則給出一組帶機率的可能——「大多往左走,偶爾直走」——再像擲骰子一樣從中挑一個。這點內建的隨機性出奇地有用:它讓機器人在學習的同時還能嘗試新做法,也讓機器人不至於可預見地卡死——否則那份嚴格的食譜會讓它一次又一次地撞向同一面牆。

一台行走機器人的策略讀取自身的傾斜角度和雙腳位置,每秒二十次地輸出每條腿馬達的下一次出力,讓自己保持站立。

策略把機器人此刻感知到的東西映射成它下一步要做的動作。

在機器人學習裡,被學出來的東西就是這套策略;強化學習是學出它的一種常見方法。

又稱
policy策略策略函数