多智能體強化學習
集中式訓練、分散式執行(centralized training, decentralized execution)
集中式訓練、分散式執行是合作式 MARL 中的主流設計範式,而它的想法妙在非常務實。訓練時、在模擬環境裡,你可以偷看一切——每個智能體的觀測、真實狀態、每個人的動作。但當訓練好的智能體真正上線時,每一個都必須只憑自己的局部視野行動,因為一台真實的機器人或玩家所擁有的就只有這些。CTDE 讓你在學習時善用上帝視角,執行時再把它丟掉。
具體來說,被部署的策略是分散的:智能體 i 的動作只取決於它自己的觀測歷史。然而學習的機制是集中的——通常是一個以全域狀態與聯合動作為條件的評論家或混合網路。這個集中式評論家給出乾淨得多的學習訊號,並穩住其他學習者所造成的移動目標,而它所塑造出的分散式策略,在現場仍可執行。
這個範式是幾乎每個現代合作式演算法的骨幹:MADDPG、COMA、VDN、QMIX、MAPPO 全都是 CTDE 方法。它的限制也很誠實:它假設你在訓練時確實能取得全域資訊(在模擬器裡通常為真,在真實世界裡往往為假),而且它並沒有消除底層的協調問題——只是給了學習者一個更好的制高點來解決它。
又称
另见