回報、價值與策略

貪婪策略(greedy policy)

貪婪策略把當前的最佳猜測照單全收:在每個狀態,它挑出此刻價值估計說最好的那個動作,完全不考慮去探索其他選項。如果你的 Q 值宣稱在這個狀態動作 a 的報酬最高,貪婪策略就出 a,每一次都是。這是「立刻兌現」的規則:利用你自以為知道的東西。

它的定義是:在每個狀態挑選那個讓 Q 取到最大的動作。一旦你的價值估計準確,貪婪行為正是你想要的;而對最佳的 Q 貪婪行動,會得到一個最佳策略。危險出現在更早的階段,也就是學習途中:對仍然搖晃不定的估計貪婪,可能把智能體鎖進一個平庸的習慣,永遠不去取樣那個其實最好的動作。這就是為什麼方法常把它軟化成 epsilon-貪婪:大多數時候出貪婪動作,偶爾出一個隨機動作。

\pi(s)=\arg\max_{a}Q(s,a)

貪婪策略在當前估計下,總是選出價值最高的動作。

又称
argmax policygreedy action selection