強化學習是什麼

動作與動作空間(action and action space)

動作(action)是智能體做出的單一選擇——向左走、加碼五元、施加這麼多馬達扭矩。動作空間(action space)則是所有可選動作的集合,也就是智能體的整套招式。把它定義好,會牽動後面的一切:選項太少,智能體無法表達好的行為;選項太多,學習就變成大海撈針。

動作空間有不同型態。離散空間是有限的選單——上、下、左、右——大多數棋類和電玩屬於此類。連續空間是取實數值的旋鈕,像方向盤角度或關節扭矩,常見於機器人與控制。有些問題兩者兼具,或某些動作只在特定狀態下合法。你面對的是哪一種,會大大影響哪些強化學習方法適用。

A_t \in \mathcal{A}(s)

在時間 t 選的動作,來自當前狀態下所允許的動作集合。