回報、價值與策略

最佳價值函數(optimal value function)

每個策略都有自己的價值函數,所以有多少種行動方式,就有多少個價值函數。最佳價值函數是其中最好的那一個:對每個狀態,它記錄任何策略所能達到的最高期望回報。可以把它想成天花板——如果你從那個狀態起一路都打得完美,所能達到的分數。

它有兩種形式,狀態用 V-star,狀態–動作對用 Q-star,星號代表「可能的最好」。一個深刻的事實讓它格外有用:單一個價值函數能同時對每個狀態都是最佳,所以你永遠不必在「從某狀態做得好」與「從另一狀態做得好」之間取捨。知道了 Q-star,基本上就解決了任務,因為對它貪婪行動就是最佳的。

V^*(s)=\max_{\pi}V^\pi(s),\qquad Q^*(s,a)=\max_{\pi}Q^\pi(s,a)

最佳價值函數,是在所有策略上取到的可達最佳值。

又稱
V*Q*