馬可夫決策過程

隨機策略(stochastic policy)

策略是智能體的方略,它選擇要做什麼的規則。隨機策略不替每個狀態鎖定唯一一步;相反地,它擲加權的骰子,給每個可選動作一個機率。在某個狀態,它可能七成的時候選左、三成選右,每次造訪都重新抽樣,而非總是做同一件事。

形式上,它是給定狀態下、動作的條件分布。隨機化帶來實在的好處:它讓智能體持續探索,而非太早鎖死於單一習慣;當世界只能部分觀測時它無可避免;而在「被看穿就會被對手利用」的賽局中,它是最佳的那種策略。它在數學上也是平滑的,而這正是策略梯度方法以梯度上升來微調行為所需要的。

\pi(a\mid s)=\Pr(a_t=a\mid s_t=s),\quad \sum_{a}\pi(a\mid s)=1

對每個狀態,給出動作的機率分布。

又称
randomised policy