函數近似

函數近似(function approximation)

真實環境的狀態多到難以想像——每一個棋盤局面、每一幀畫面。你不可能替每個狀態各存一個數字。函數近似(function approximation)用一個精簡的、帶參數的函數取代那張龐大的查表:輸入一個狀態(或狀態–動作對),它就用少少幾個權重算出價值或動作機率。學習就是調整這些權重,而不是把表格一格一格填滿。

形式上我們挑一個帶參數的函數族,例如一個估計 v(s; w) 接近真值,再用梯度步驟調整權重向量 w,把預測推向某個目標(一段報酬,或一個自舉估計)。同樣的想法也適用於以參數表示的策略 pi(a|s)。因為相鄰狀態共用權重,對某個狀態的更新會推廣到相似狀態——這既是它的威力(少量樣本就能學),也是它的危險(互相干擾、不穩定)。

正是這一點讓強化學習能擴展到圍棋、機器人與原始像素;深度強化學習其實就是用神經網路做函數近似。但強化學習裡幾乎所有棘手的收斂問題——發散、致命三要素、過度估計——都誕生於此,因為表格法那些乾淨的保證在這裡不再成立。

\hat v(s;\mathbf{w})\approx v_\pi(s),\quad \mathbf{w}\in\mathbb{R}^d,\ d\ll|\mathcal{S}|

用精簡的權重向量取代逐狀態的表格;維度 d 遠小於狀態數。

與監督式的函數近似不同,這裡的回歸目標並非定態,而且常是從模型自身不斷變動的預測自舉而來。

又稱
value function approximationparametric value functions