函數近似

擬合 Q 迭代(fitted Q-iteration, FQI)

把批次、離策略的 Q 學習改寫成一連串普通的監督式學習問題。先一次性收集一個固定的轉移資料集 (s, a, r, s')。然後反覆:用目前的 Q 替每個轉移算一個回歸目標,擬合一個全新的回歸器(隨機森林、神經網路,什麼都行)去預測這些目標,再把結果當成新的 Q。學習過程中完全不與環境互動。

目標是 y = r + gamma max_{a'} Q_old(s', a');每一輪求解對這些目標的最小平方擬合。因為它就是套在迴圈裡的監督式回歸,你可以塞進現成的強力學習器,並大量重複使用資料,這使它樣本效率高。DQN 基本上就是擬合 Q 迭代的線上、神經、小批次版本,外加一個緩慢更新的目標網路。

它繼承了函數近似的所有風險——目標裡的 max 造成過度估計,而一個無法覆蓋貪婪策略所會造訪狀態的固定資料集,則造成外推誤差(這正是離線強化學習必須處理的核心問題)。難的是穩定性與覆蓋率,而非最佳化本身。

y_i=r_i+\gamma\max_{a'}Q_{\text{old}}(s_i',a');\quad Q_{\text{new}}=\arg\min_{\theta}\sum_i\big(Q(s_i,a_i;\theta)-y_i\big)^2

擬合 Q 迭代:在固定批次上反覆做監督式回歸。

又称
FQIbatch Q-learning