強化學習理論
分布式強化學習(distributional RL)
分布式強化學習學的是某個狀態-動作對「回報的整個分布」,而不只是它的平均值。兩個動作可能有相同的期望回報,但離散程度天差地別,一個偶爾災難、另一個穩定如常;只建模平均值,等於正好丟掉了這項資訊。
它以作用在回報隨機變數上的分布式貝爾曼算子取代純量貝爾曼方程:回報分布等於即時報酬,加上下一個狀態-動作分布經折扣與平移後的副本。表示法包括以投影交叉熵損失訓練、採固定支撐的類別分布(C51),以及學習一組分位數位置的分位數回歸(QR-DQN、IQN)。該算子在最大型瓦瑟斯坦(Wasserstein)度量下是壓縮映射,而非在 KL 下。
即使最終仍依平均值行動,攜帶完整分布往往能改善表徵學習與穩定性,並開啟對風險敏感的策略,使其能偏好或迴避變異。
Z(s,a)\ \stackrel{D}{=}\ R(s,a)+\gamma\,Z(S',A')
分布式貝爾曼方程:回報隨機變數在分布意義上等於報酬加上折扣後的下一步回報。
分布式貝爾曼算子在瓦瑟斯坦度量下壓縮,而非在 KL 下;採用 KL 損失是實務上的近似,並非其底層理論。
又稱
另見