應用、環境與模擬到真實
用強化學習做機器人操作(robotic manipulation with RL)
操作指的是教機器手臂與夾爪去抓取、推動、堆疊、插入或重新擺放物體——這是幼兒覺得輕鬆、機器人卻覺得極其困難的任務,因為接觸難以預測,而手與物體的擺位組合空間又大得驚人。
狀態可能是關節角度加上相機影像;動作是關節力矩或末端執行器的運動;獎勵則編碼任務成功,例如物體被舉起、或銷釘被插入。RL 之所以吸引人,是因為它能發掘那些難以手寫程式的、富含接觸的技能。但真實機器人的資料稀少,所以多數研究會在模擬中搭配領域隨機化訓練、藉由模仿學習從人類示範起步,或從記錄下來的互動做離線學習。
這裡的獎勵設計很微妙。只看成敗的稀疏獎勵很誠實,卻極難學;而密集的塑形獎勵又容易被鑽漏洞——夾爪會學到在物體附近徘徊以騙取部分分數,而不是真的把它抓起來。
又称
另见