強化學習理論

多智能體強化學習(multi-agent reinforcement learning, MARL)

多智能體強化學習一次把多個學習中的代理人放進同一個世界。它們一旦共享環境,每個代理人所處的環境就變得非平穩(non-stationary),因為其他代理人也在學習與改變,於是昨天看似最優的目標,今天可能就錯了。合作、競爭,乃至溝通,全都成了必須學習的一部分。

它真正的基礎是賽局理論:此設定是隨機賽局(或稱馬可夫賽局),而恰當的解的概念是均衡——如納許均衡或相關均衡——而非單一最優解。主流的實務範式是「集中式訓練、分散式執行」(CTDE):訓練時由集中式評論家看見所有代理人的觀測與動作,如 MADDPG 或 QMIX 這類價值分解(value-factorization)方法,而執行時每個策略只依自己的局部觀測行動。困難之處在於非平穩性、在代理人之間做功勞分派,以及隨代理人數呈指數成長的聯合動作空間。

自我對弈(self-play)與族群式訓練能催生出引人注目的湧現策略,但在零和賽局或位勢賽局等特殊結構之外,收斂保證十分薄弱。

從任一代理人的視角看,其他代理人使環境變得非平穩,這正是為何獨立的單代理人學習者在 MARL 中常無法收斂。

又称
MARL多智能體強化學習多代理人強化學習