動態規劃
廣義策略迭代(generalized policy iteration,GPI)
策略迭代與價值迭代看起來像不同的演算法,但它們共用一個想法:同時保有一個價值估計和一個策略,讓兩者互相推著對方走向一致。廣義策略迭代(GPI)就是這個想法最寬鬆的說法——你不必把評估做完才改進,也不必一次在所有地方改進。幾乎每一種強化學習方法,都是這支舞的某種變奏。
兩個過程一起運轉。評估讓價值函數對當前策略更準確;改進讓策略對當前價值函數更貪婪。它們彼此拉扯——把策略變貪婪會破壞價值估計,而重新評估又會讓策略不再貪婪——然而它們唯一共同的歇腳點,就是最佳:此時策略對它自己正確的價值採取貪婪選擇。只要兩個過程都持續有進展,這一對就會收斂到那裡。
又稱
另見