JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

真實世界中的強化學習:機器人、汽車與控制

模擬器之外是會帶來後果的硬體。強化學習如何抓取物體、駕駛汽車、調校實體系統——以及一旦動作觸及真實世界,安全為何改變了一切。

操作:最難的簡單事

拿起一個杯子,對幼兒微不足道,對機器人卻難如登天。機器人操作牽涉接觸密集的物理——抓握、滑動、手中重新定向——其中微小誤差會層層放大,數學上也不平滑。強化學習在這裡大放異彩,因為它能發現那些手寫程式很難寫出的控制策略,學會從滑脫中恢復、即時調整握力。

靈巧操作(dexterous manipulation)的代表性成果——多指機械手解魔術方塊、翻轉方塊——幾乎完全仰賴上一篇的模擬到真實工具箱:在隨機化的模擬中訓練,再轉移。真實機器人珍貴又緩慢;學習則發生在模擬器裡。

自動駕駛:強化學習與風險相遇之處

強化學習用於自動駕駛既誘人又危險,兩者程度相當。汽車是序列決策的極致典範——每一次轉向與煞車都形塑下一個觀測——但學習中的代理人不能在時速一百公里下「試試看」某個動作。因此這個領域大量仰賴高擬真模擬、從紀錄下來的人類駕駛中學習,並把強化學習用於子問題(變換車道、匯入、路口協商),而非端到端地控制整輛車。

智慧體–環境迴圈:自動駕駛汽車觀察、行動,每一次轉向或刹車都會重塑它接下來必須應對的狀態。

強化學習迴圈示意圖:智慧體採取行動,環境返回新狀態與獎勵,如此循環。

控制:調校實體系統

強化學習許多低調的工業勝利,都在實體或工業系統的連續控制上:強化學習用於能源與控制涵蓋資料中心冷卻、托卡馬克電漿調節、電網平衡與空調調校。這些看似不起眼,卻是理想對象:目標(耗能、維持穩定)可量測、通常存在像樣的模擬器,而幾個百分點的效率就值數百萬。

\nabla_\theta J(\theta) = \mathbb{E}_{\pi_\theta}\!\left[\nabla_\theta \log \pi_\theta(a\mid s)\, Q^{\pi_\theta}(s,a)\right]

策略梯度定理——機器人與工業系統的連續控制策略據此被推向更高的回報。

這些部署仍然敬畏現實鴻溝。營運者通常在模擬中訓練與驗證,再讓學到的策略以受監督或影子模式對照既有控制器運行,之後才真正交棒——而且永遠備有一個安全的後備機制。

安全改變了一切

一旦動作牽動真實的質量或真實的金錢,安全強化學習就不再是可有可無。探索——強化學習的引擎本身——必須受到約束,讓代理人連一次災難性動作都不會嘗試。做法包括:對動作空間施加硬性約束、採用緊貼已知安全行為的保守策略,以及明確的風險懲罰。

安全與獎勵深深糾纏:一個忽略某項危害的獎勵,等於邀請代理人直直撞上去。設計能同時編碼目標約束的獎勵,本身就是一門學問——獎勵工程——這正是最後一篇要正面處理的主題。

\max_{\pi}\; \mathbb{E}_{\pi}\!\left[\sum_t \gamma^t r_t\right] \quad \text{s.t.}\quad \mathbb{E}_{\pi}\!\left[\sum_t \gamma^t c_t\right] \le d

把安全強化學習視為約束問題:在使期望累積代價(危害)保持在硬性上限以下的同時最大化獎勵。