策略梯度方法

熵正規化(entropy regularization)

學習中的策略可能太早墜入愛河——它找到一個還不錯的動作,就一直選它、不再嘗試別的,於是永遠發現不了更好的。熵正規化對抗這種過早的自信,做法是付給策略一筆小獎金,鼓勵它維持不確定。熵衡量一個分布有多分散,所以獎勵熵,字面上就是付錢讓智能體保留選項、繼續探索。

實務上你在目標裡加一項 β·H(π(·|s)),其中 H 是動作分布的熵,β 是一個小係數。策略梯度於是同時把策略推向高報酬動作、也推向不要塌縮成單一動作。訓練早期 β 讓探索保持活著;隨著學習成熟,你常會把 β 逐漸退火調小,好讓策略最終能朝最佳動作收斂變銳。

再推進一步,熵就不只是正規化器,而是最大熵強化學習的核心——智能體把「報酬加熵」當成統一目標來最大化,這正是 soft actor-critic 背後的想法。誠實的提醒在於調參:熵太多,智能體會一直含糊地隨機、無法下定決心;太少,它又會太早塌縮、卡住不前。

J(\theta)=\mathbb{E}_{\pi_\theta}\!\left[\sum_t r_t\right]+\beta\,\mathbb{E}_{s}\big[\mathcal{H}\!\left(\pi_\theta(\cdot\mid s)\right)\big]

為「保持動作分布不確定」加上一筆獎金。

又称
entropy bonus