強化學習理論

價值函數近似誤差界(value-function approximation error bounds)

一旦你用函數近似器——線性模型、神經網路——取代精確的價值表,你就在每一步接受了一些擬合誤差。可怕的問題是:這些每步的小誤差會維持很小,還是動態規劃裡的自助會把它們放大成「你最終得到的策略與最優之間的大落差」?近似誤差界正是回答「局部誤差預算如何換算成最終效能損失」。

近似價值迭代或策略迭代的經典結果說:貪婪策略的效能落差,被「每次迭代最壞的近似誤差」所界定,並放大約 2γ/(1−γ)² 倍。那個視界平方項就是警訊:在長視界問題中,即使極小的近似誤差也可能爆掉。更精細的分析會把最大範數誤差換成與狀態造訪分布綁定的加權 L2 範數,這就是為什麼實務上「在對的狀態分布上訓練」如此重要。

這些界是最壞情況且常常很鬆,但它們的結構才是教訓:誤差透過自助複合、視界是放大器,而你評估誤差所用的分布是界的一部分,不是事後補上的。

\lVert V^{\pi_k}-V^{*}\rVert_\infty\ \le\ \frac{2\gamma}{(1-\gamma)^2}\,\max_k\lVert \varepsilon_k\rVert_\infty

近似動態規劃:每步誤差 ε 被有效視界的平方放大。