函數近似
函數近似下的發散(divergence under function approximation)
這是致命三要素造成的失效模式:價值估計不但不安定下來,反而無界地增長,常常先震盪、再衝向正負無窮。你會看到損失爆炸、預測變成 NaN、智能體的行為崩潰。這不是學得慢——而是演算法主動把自己推散。
自舉、離策略、近似的更新並不保證是收縮。合成後的更新算子其有效增益可能大於一,於是每一輪都放大誤差、而非縮小。Baird 的星形反例在一個極小的線性問題上展示了這點:即使存在完美的表徵、真值全為零,TD 權重依然發散。
發散正是天真的深度 Q 學習不穩定的原因,也是目標網路、回放緩衝區、更小或衰減的步長、梯度裁剪與梯度 TD 方法存在的理由。近似強化學習的收斂從不是理所當然——它必須針對所用元件的特定組合去工程化或證明出來。
又稱
另見