強化學習理論

最大熵強化學習(maximum-entropy RL)

最大熵強化學習重新框定目標,使代理人在把事情做好的同時,既因報酬獲得獎勵,也因行為盡量不可預測而獲得獎勵。其回報是:所得行為不是單一脆弱的最優解,而是一整族接近最優的策略,往往更善於探索,並在條件改變時優雅地退化而非崩潰。

形式上,目標在報酬之外,於每一步加上溫度係數乘以策略的熵。此時最優策略是柔性 Q 值上的波茲曼分布:選取動作的機率正比於「柔性 Q 除以溫度」後取指數。這導出柔性價值函數與柔性貝爾曼方程,並透過「控制即推論」(control as inference)觀點把強化學習連結到機率推論,也連結到能量基(energy-based)策略。柔性演員-評論家(SAC)便是它在實務上的離策略實作。

溫度在報酬與熵之間取捨:當它趨近於零,柔性策略會銳化成貪婪策略,於是還原成標準強化學習。

\pi^*(a\mid s)\ \propto\ \exp\!\Big(\tfrac{1}{\alpha}\,Q_{\text{soft}}(s,a)\Big)

最優最大熵策略是柔性 Q 值上的波茲曼分布,並由溫度 alpha 決定其銳利程度。

最大熵強化學習不只是探索的啟發法;它是一個不同且定義良好的最優目標,其解是一個隨機的波茲曼策略。

又稱
max-ent RL最大熵強化學習