連續控制

連續動作空間(continuous action spaces)

多數入門強化學習想像的是幾顆按鈕:往左、往右、跳。但要一個智能體去開車、設定機器手肘的扭矩、或決定用藥劑量時,根本沒有按鈕——動作是一個實數,或一整個實數向量,可在某個範圍內取任意值。這就是連續動作空間:智能體不是從有限選單裡挑,而是輸出 ℝ^n 裡的一個點,通常還落在框型上下界內,例如方向盤角度介於 −1 到 1 之間。

從離散跨到連續,會打斷價值法強化學習的看家本領。Q 學習靠掃過每個選項取最大值來挑最佳動作,但你無法把無窮多的實數動作一一列舉,而那個最大化 max_a Q(s,a) 在每一步都成了自身的難解最佳化問題。於是連續控制改靠直接輸出動作的策略——一個確定性映射,或一個你會去抽樣的分布之參數——藉此繞開那個做不到的取最大值。

這正是為什麼有一整族演算法專為此情境而生:DDPG、TD3、SAC 都在回答同一個問題——當動作是旋鈕而非開關時,該如何學習並改進策略。回報是:最貼近物理現實的問題——移動、飛行、操作、製程控制——本就是連續的,所以精通這個空間,就是精通對真實機器的控制。

連續不代表無界——幾乎所有真實致動器都有極限,所以動作活在一個框裡,這也是為何「限界」與「擠壓」如此重要。

又称
real-valued action spaces