操作:最難的簡單事
拿起一個杯子,對幼兒微不足道,對機器人卻難如登天。機器人操作牽涉接觸密集的物理——抓握、滑動、手中重新定向——其中微小誤差會層層放大,數學上也不平滑。強化學習在這裡大放異彩,因為它能發現那些手寫程式很難寫出的控制策略,學會從滑脫中恢復、即時調整握力。
靈巧操作(dexterous manipulation)的代表性成果——多指機械手解魔術方塊、翻轉方塊——幾乎完全仰賴上一篇的模擬到真實工具箱:在隨機化的模擬中訓練,再轉移。真實機器人珍貴又緩慢;學習則發生在模擬器裡。
自動駕駛:強化學習與風險相遇之處
強化學習用於自動駕駛既誘人又危險,兩者程度相當。汽車是序列決策的極致典範——每一次轉向與煞車都形塑下一個觀測——但學習中的代理人不能在時速一百公里下「試試看」某個動作。因此這個領域大量仰賴高擬真模擬、從紀錄下來的人類駕駛中學習,並把強化學習用於子問題(變換車道、匯入、路口協商),而非端到端地控制整輛車。
強化學習迴圈示意圖:智慧體採取行動,環境返回新狀態與獎勵,如此循環。
控制:調校實體系統
強化學習許多低調的工業勝利,都在實體或工業系統的連續控制上:強化學習用於能源與控制涵蓋資料中心冷卻、托卡馬克電漿調節、電網平衡與空調調校。這些看似不起眼,卻是理想對象:目標(耗能、維持穩定)可量測、通常存在像樣的模擬器,而幾個百分點的效率就值數百萬。
策略梯度定理——機器人與工業系統的連續控制策略據此被推向更高的回報。
這些部署仍然敬畏現實鴻溝。營運者通常在模擬中訓練與驗證,再讓學到的策略以受監督或影子模式對照既有控制器運行,之後才真正交棒——而且永遠備有一個安全的後備機制。
安全改變了一切
一旦動作牽動真實的質量或真實的金錢,安全強化學習就不再是可有可無。探索——強化學習的引擎本身——必須受到約束,讓代理人連一次災難性動作都不會嘗試。做法包括:對動作空間施加硬性約束、採用緊貼已知安全行為的保守策略,以及明確的風險懲罰。
安全與獎勵深深糾纏:一個忽略某項危害的獎勵,等於邀請代理人直直撞上去。設計能同時編碼目標與約束的獎勵,本身就是一門學問——獎勵工程——這正是最後一篇要正面處理的主題。
把安全強化學習視為約束問題:在使期望累積代價(危害)保持在硬性上限以下的同時最大化獎勵。