回報、價值與策略
確定性策略(deterministic policy)
確定性策略是最簡單的一種規則:在任何給定狀態,它總是挑同一個單一動作,沒有任何隨機成分。把同樣的處境給它看兩次,你會看到同樣的動作兩次。這就像一份嚴格的食譜——走到這一步,就做這件事——也是我們通常想像一位心意已定的專家的樣子。
它寫成一個普通函數 a 等於 pi(s),把每個狀態直接映射到一個動作,而不是映射到動作的分布。確定性策略很吸引人,因為有限馬可夫決策過程保證存在一個最佳的確定性策略,而且很容易照著行動。它的弱點在於探索:一個總是做同樣事情的智能體,永遠無法發現某個沒試過的動作是否更好,所以在學習過程中,我們通常從外部注入隨機性。
另見