強化學習

策略梯度(policy gradient)

/ POL-uh-see GRAY-dee-unt /

策略梯度方法走的是一條令人耳目一新的直路:它不去費力估計每個動作有多好、再從中讀出策略,而是直接調整策略本身。策略是一組旋鈕(神經網路的權重),把一種情形轉化為各動作的機率。策略梯度觀察回合是好是壞,然後轉動旋鈕,讓好的行為更可能發生、壞的行為更不可能發生——直截了當的逐獎勵而動,徑直作用在策略上。

其機理像是用強化來雕塑。智能體打完一整個回合,把獎勵算清,然後對它走過的每一個動作發問:事情比預期更好嗎?若是,就把那個動作的機率往上推一點;若更糟,就往下推。「梯度」不過是那門告訴你每個旋鈕該往哪個方向擰的微積分。在許多回合裡這樣跑下去,策略便朝著「賺得更多」的行為漂移。

最大的紅利是靈活。正因為策略可以輸出任意種類的動作——包括方向盤轉角、關節力矩這類平滑、連續的動作——策略梯度能對付那些讓 Q 方法被無窮多選項噎住的問題。它還天然產出隨機性策略,對虛張聲勢與探索都有用。誠實的代價是,那個原始的學習信號非常嘈雜:用整整一個回合的結果去評判單個動作,會讓訓練抖動不已、對樣本極其飢渴——而這恰恰是演員—評論家與 PPO 這類改良存在的理由。

訓練一輛小車去平衡一根桿子:策略輸出「往左推」對「往右推」的機率。智能體玩一個回合;如果桿子立了很久(高獎勵),那個回合裡它做過的每一次推,下一次都會被調得更可能發生一點。幾千個回合之後,平衡的行為便自行湧現。

讓來自好回合的動作更可能、壞的更不可能——直接調整策略,無需 Q 表。

策略梯度在動作選擇是連續的場合(機器人控制)大放異彩,那正是基於價值的方法吃力之處。代價是高方差:由於用整個回合的獎勵去評判單個動作,學習訊號很嘈雜,所以這類方法常常需要大量樣本和精心調參,才能穩定地訓練。

又稱
REINFORCEpolicy-gradient methods策略梯度方法直接策略优化