連續控制

最大熵強化學習目標(maximum-entropy RL objective)

標準強化學習只要一件事:收集最多獎勵的策略。最大熵強化學習同時要兩件事——收集獎勵,並在過程中盡量保持隨機。熵不過是一個衡量分布有多分散的數字:總是挑同一個動作的策略熵為零,在各選項間均勻挑選的策略熵很高。這個目標把熵(乘上一個溫度)加進獎勵裡,於是智能體因為保留選擇空間而多領到一點報償。

為什麼要刻意加隨機?在控制裡有三個重要理由。它探索得更好,因為它從不過早鎖死在單一動作,會持續試探其他可能。它更穩健,因為一個在保持多變下仍成功的策略,並非站在一個被小擾動就推倒的刀鋒上。而且它能捕捉多個好解,而非任意地塌縮到其中一個。溫度則調節這份取捨:溫度高偏向隨機,溫度低就回到一般的最大化獎勵強化學習。

這個目標是柔性演員–評論家的理論核心,「柔性」一詞正指它:價值函數變得「柔軟」,是因為它們的貝爾曼回填納入了熵獎勵。它把強化學習連到機率推論——把「行動得好」重新表述為從「好行為的分布」中抽樣,而非挑出單一最佳者。

J(\pi)=\sum_t \mathbb{E}_{(s_t,a_t)\sim\pi}\big[r(s_t,a_t)+\alpha\,\mathcal{H}\big(\pi(\cdot\mid s_t)\big)\big]

最大化「獎勵加上策略的熵」,並以溫度 α 加權。

又稱
entropy-regularized RLMaxEnt RL