強化學習理論

壓縮映射(contraction mapping)

壓縮映射是一種算子,永遠把兩點拉得更近:把它作用到任一對價值函數上,兩者的距離至少會縮小一個固定比例。這個單一的幾何事實,是動態規劃裡幾乎所有收斂證明的引擎。若反覆套用一個算子會持續壓縮空間,迭代就必然漏斗般地匯向唯一的安歇點。

在強化學習中,這個算子是貝爾曼算子(Bellman operator),固定比例就是折扣 γ < 1。用最大範數(對狀態取上確界)來量,策略評估算子與貝爾曼最優算子都是 γ-壓縮。巴拿赫不動點定理於是保證有唯一不動點——價值函數 V^π 或最優 V*——而且價值迭代會幾何式收斂到它,誤差在 k 次掃描後大約以 γ 的 k 次方縮小。

這個壓縮是活在最大範數裡的。一旦你在不同的範數下近似價值(最小平方擬合是在 L2 範數下做的),算子在那個範數下可能就不再是壓縮,這正是近似動態規劃失去乾淨保證的地方。

\lVert T V_1 - T V_2\rVert_\infty \le \gamma\,\lVert V_1 - V_2\rVert_\infty

貝爾曼算子 T 在最大範數下是 γ-壓縮,逼出唯一的不動點。