回報、價值與策略
最佳策略(optimal policy)
最佳策略是一種你無法被超越的行動方式——沒有別的策略能從任何狀態拿到更高的期望回報。它正是整套價值機制要尋找的目標:那條只要忠實遵循,就能最大化長期折扣獎勵的規則。在迷宮裡,它是最快抵達出口的一連串轉彎;在遊戲裡,它是盡可能常贏的策略。
一個令人安心的定理說:對任何有限的馬可夫決策過程,至少存在一個最佳策略,而且其中至少有一個是確定性的——你永遠不必靠賭運才能打得完美。可能會有並列,好幾個一樣好的策略,但它們共享同一個最佳價值函數。取得最佳策略的常見配方是:先算出 Q-star,再在每個狀態挑選最佳動作價值最大的那個動作。
\pi^*(s)=\arg\max_{a}Q^*(s,a)
最佳策略,就是對最佳動作價值函數貪婪行動。
又称
另见