策略梯度方法
A2C(同步優勢演員–評論家,synchronous advantage actor-critic)
A2C 是優勢演員–評論家整潔的同步版本。你平行跑許多份環境,讓每一份走固定步數,然後全部停下、把所有轉移蒐集成一個大批次,才做一次更新。可以想像一排遊戲機同時暫停,好讓你一起讀它們的螢幕——這個「同時」正是重點所在。
跨平行演員做批次處理,讓你不必使用重播緩衝區就得到去相關、多樣的經驗,既穩定梯度又能高效利用硬體——一次大矩陣更新,勝過許多次小更新。每次更新計算優勢(常用 GAE),走一步演員、一步評論家,然後所有工作者從暫停處續跑。它是確定性的、容易重現,這點和它的非同步表親不同。
歷史上,A2C 的提出源於一個觀察:A3C 裡的非同步其實並非必要——同步版本表現相當甚至更好,而且更易實作與除錯。它至今仍是乾淨而強的基準,也是通往 PPO 的概念踏腳石——PPO 基本上就是在這個迴圈之上加了一個裁剪過的目標。
又称
另见