蒙地卡羅與時間差分學習

期望 SARSA(Expected SARSA)

SARSA 的目標是抽樣一個下一動作、用它的價值來形成;Q-learning 則取唯一最好的下一動作。期望 SARSA 折衷兩者:它使用下一狀態在策略下的期望價值,把所有可能下一動作的價值按策略選到它們的機率加權平均。它用一個平滑的期望,取代了一個帶雜訊的單一樣本。

拿掉那一步抽樣就拿掉了一個變異數來源,所以期望 SARSA 通常學得更穩定,能採用比一般 SARSA 更大的步長,而額外計算往往不多。它也很靈活:在你正遵循的同一策略下取平均,它就是同策略(on-policy);在一個貪婪的目標策略下取平均,它就剛好變成 Q-learning,這也是為什麼它有時被視為一步時間差分控制的統一觀點。

Q(s,a)\leftarrow Q(s,a)+\alpha\,[\,r+\gamma\sum_{a'}\pi(a'\mid s')\,Q(s',a')-Q(s,a)\,]

期望 SARSA:目標是在策略下對下一動作價值取平均,而非抽樣其中一個。

又称
expected Sarsa