函數近似
近似下的過度估計(overestimation under approximation)
Q 學習的目標會對動作取 max,而只要估計帶有雜訊,max 就會系統性地偏高:看起來最好的那個動作,往往只是誤差剛好最正的那個。函數近似恰恰到處都加進這種雜訊、又在狀態間共享它,於是 max 會系統性地撿起那些被高估的值——自舉再把灌水後的價值往整個價值函數裡反向傳播。
若 Q 的誤差期望為零,則「對動作取 max 的期望」至少等於「期望之中取 max」(對 max 用 Jensen 不等式)。每次回填都用這個取過 max、過度樂觀的目標,下一次回填又疊在它之上,於是樂觀層層累積。雙 Q 學習用一個網路挑出取最大的動作、用另一個分開的網路去評估它,藉此把「選擇」與「評估」解耦來抑制這點;截斷式雙 Q(如 TD3 與 SAC)則取兩個評論家的最小值。
過度估計通常有害(它把策略扭向被高估的動作,還可能驅動發散),不過一點點樂觀有助於探索。在離線強化學習裡它是頭號大敵——智能體會高估資料中不存在的動作——這正是保守式方法刻意把價值估計往下壓的原因。
\mathbb{E}\big[\max_a \hat Q(s,a)\big]\ \ge\ \max_a \mathbb{E}\big[\hat Q(s,a)\big]
對帶雜訊估計取 max 會偏高(Jensen 不等式)。
在離線強化學習裡,這個偏差是核心失效模式,這正是保守式方法刻意低估的原因。
又稱
另見