連續控制

移動任務(locomotion tasks)

移動任務要智能體學會如何讓一具身體在空間中移動——藉由協調眾多關節的扭矩來走、跑、跳或奔。它是連續控制的招牌應用,因為它如此直觀有感:一隻模擬獵豹從一開始亂揮的一團,逐漸找到流暢的奔跑,是強化學習最令人滿足的展示之一,而這份成就是真的——沒人寫過那套步態,是智能體自己找到的。

它難在「物理之下的協調」。動作是一個高維的關節扭矩向量,每隔幾毫秒就要施加一次;平衡岌岌可危,一步踏錯就結束回合,正確的動作只能從眾多致動器與動量、重力、地面接觸的相互作用中浮現。獎勵通常很簡單——前進速度減去一點能量成本——但智能體必須從這份微薄訊號裡,發掘出一整套精巧的步態節奏。

移動是 SAC、TD3、PPO 例行受測之處,而這裡的進展已跨進真實世界:學到的控制器如今跑在實體四足與雙足機器人上。它也暴露出一個反覆出現的張力——智能體很容易找到「鑽模擬器漏洞」的獎勵駭客步態,而非以你期望的方式移動,提醒著你:真正被最優化的是獎勵,而非你的想像。

又称
learning to walkgait learning