強化學習理論

平均報酬準則(average-reward criterion)

折扣天生偏好「早拿到的報酬勝過晚拿到的」,這對回合式任務很自然,但對本該永遠運行的系統——伺服器、電網、交易迴圈——就顯得奇怪。平均報酬準則丟掉折扣,改為最佳化「長期每步報酬」:若你無限期執行這個策略,它累積報酬的穩定速率是多少?對於持續、不終止的問題,這往往是更誠實的目標。

理論把折扣式貝爾曼方程換成平均報酬版本,核心是增益(gain,最優的每步報酬,一個純量)與偏差或差分價值函數(從某狀態起步相對於另一狀態的暫態優勢)。最優方程讀作:報酬加上期望的下一差分價值,等於增益加上當前差分價值。這裡沒有 γ 提供壓縮,所以收斂論證更細膩,通常需要對鏈的結構作假設,例如 MDP 是可溝通的或遍歷的。

平均報酬強化學習理論上乾淨,實務上卻較少見,因為少了折扣就拿掉了讓折扣式演算法穩定的那個方便壓縮;它最重要的時機,恰恰是折扣會扭曲一個真正長視界目標的時候。

g^{*}+h^{*}(s)=\max_{a}\Big[r(s,a)+\sum_{s'}P(s'\mid s,a)\,h^{*}(s')\Big]

平均報酬最優方程;g* 是最優增益,h* 是差分價值。

又稱
gain optimality