多智能體強化學習

多智能體 PPO(MAPPO)

MAPPO 其實就是近端策略最佳化——那個單智能體策略梯度的主力方法——以 CTDE 的方式搬到合作式隊伍上。每個智能體有自己依局部觀測行動的策略,並共享(或各自保有)一個訓練時看得到全域狀態的集中式評論家。你蒐集聯合經驗,用那個集中式價值估計優勢,再用 PPO 熟悉的截斷目標更新每個策略。它幾乎平實到無聊——而這正是重點。

讓 MAPPO 受矚目的是經驗結果,而非理論:一項仔細的研究發現,只要少數幾個實作細節做對——集中式價值函數、合理的輸入特徵(包含智能體編號)、價值正規化,以及足夠的平行資料——這個樸素的同策略配方,在標準合作式基準上就能匹敵甚至勝過遠為精巧的價值分解方法。它悄悄推翻了「合作式 MARL 需要特製離策略機制」這個假設。

它的取捨是一般同策略方法的取捨,並因智能體眾多而放大:PPO 很吃樣本,因為每次更新後就丟掉資料,所以 MAPPO 高度倚賴便宜、大規模平行的模擬。在你擁有這種條件的地方,它是強大、簡單而出奇可靠的預設選擇;在樣本珍貴的地方,價值分解或離策略方法可能仍佔上風。它的崛起很好地提醒我們:調得好的簡單方法,往往勝過花俏的方法。

又称
MAPPO