策略梯度方法

A3C(非同步優勢演員–評論家,asynchronous advantage actor-critic)

A3C 是早期一個極具影響力的辦法,讓深度策略梯度能在普通 CPU 上運作。它生成許多「演員–學習者」,每個都有自己一份環境,同時探索世界的不同角落。每個工作者用自己的小批次算梯度,一準備好就把它套到一組共享參數上——不必等別人。眾多同時探索者帶來的多樣性,正是穩定學習的關鍵。

非同步是它的定義性特徵:工作者讀取共享參數,跑一段短的展開,算出一個優勢演員–評論家梯度,然後不上鎖地把更新推回去。這讓資料在時間上去相關(替代了經驗重播),在當年的多核機器上很快。代價是「陳舊」——一個工作者的梯度,可能是對著略為過時的參數算出來的。

A3C 在歷史上之所以重要,是因為它證明了:靠平行、而非重播緩衝區,也能穩定同策略的深度強化學習。但它的非確定性讓它難以重現與調校,加上後來發現同步版本(A2C)表現相當甚至更好、又更簡單且對 GPU 友善,於是今日 A2C 與 PPO 成了更常見的選擇。

又稱
asynchronous advantage actor-critic