回報、價值與策略

策略改進定理(policy improvement theorem)

策略改進定理,是讓強化學習往上爬、而不是亂走的那個保證。它說:拿你當前的策略,評估它以得到它的價值函數,再建一個對該函數貪婪行動——挑出價值最高的動作——的新策略。這個新策略在任何狀態都不會比舊的差;而且除非舊的本來就已經是最佳,否則它在某處嚴格更好。

這個單一結果就是策略迭代的心跳:評估,然後改進,再評估改進後的結果,如此反覆。每一輪要嘛真正取得進展,要嘛就示意你已經抵達一個最佳策略,因為再多走一步貪婪也幫不上忙。這條定理說明了為什麼「估計價值,再對它們貪婪行動」不只是一個經驗法則,而是一個在有限馬可夫決策過程中,可被證明會收斂到最佳行為的方法。

貪婪改進需要對當前策略而言準確的價值函數;若對糟糕的估計貪婪行動,這個保證就會蒸發。