強化學習理論

模擬引理(simulation lemma)

假設你學到一個略有偏差的世界模型——它的轉移機率與報酬接近現實但不精確。若你在這個不完美的模擬器裡規劃出一個很棒的策略,它在真實環境中會有多好?模擬引理給出乾淨的答案:你算出的價值誤差,被你的模型誤差所控制,所以「夠好的模型」會產出「夠好的策略」。

此引理把「策略在真實 MDP 的價值」與「在估計 MDP 的價值」之差,界定為模型的報酬與轉移誤差,各自再乘上有效視界 1/(1−γ)。由於這個界只依賴模型準確度與視界,它讓你能把「學到好策略」這整個問題,化約成「學到準確模型」這個更乾淨的統計問題——而這正是基於模型的強化學習、以及 UCRL 等後悔證明背後的策略。

視界因子再次警告:小的模型誤差會在長視界上被放大,而要在所有狀態上取得一致的模型準確度可能很昂貴;精細的版本會用「策略實際造訪每個狀態的頻率」來加權誤差,在重要之處把界收得更緊。

\big|V^{\pi}_{M}-V^{\pi}_{\hat M}\big|\ \le\ \frac{1}{1-\gamma}\Big(\epsilon_r+\frac{\gamma\,R_{\max}}{1-\gamma}\,\epsilon_P\Big)

模擬引理:價值落差被報酬誤差 ε_r 與轉移誤差 ε_P 所界定。