動態規劃

策略迭代(policy iteration)

策略迭代把你現在擁有的兩個動作——先衡量、再改進——交替進行,直到它們不再改變任何東西。完整評估當前策略,對那些價值取貪婪得到新策略,再完整評估新策略,如此反覆。每一輪都產生嚴格更好的策略,直到再也無法改進為止,這時你手上的就是最佳策略。

它是一個雙層迴圈演算法:內層迴圈把策略評估跑到收斂,外層迴圈執行一次策略改進。由於確定性策略只有有限多個,而每次迭代都嚴格更好(或相等,這代表該停了),策略迭代會在有限的外層步數內到達最佳策略——即使在很大的狀態空間裡,所需步數往往出乎意料地少。

\pi_0\xrightarrow{\;E\;}v_{\pi_0}\xrightarrow{\;I\;}\pi_1\xrightarrow{\;E\;}\cdots\xrightarrow{\;I\;}\pi_*

評估(E)與改進(I)交替進行,直到最佳策略。