多智能體強化學習

合作式多智能體強化學習(cooperative multi-agent RL)

合作式 MARL 是這個領域最友善的角落:每個智能體都在同一隊、想要同一件事。想像一支倉儲機器人車隊,靠出貨多快一起贏或一起輸;或者合作型電玩裡的玩家,一同追同一個分數。因為目標是共享的,所以沒有對抗關係要建模——整個挑戰在於:讓各個個體協調成對整體有利的行為。

把它講乾淨的方式,是一個每一步所有智能體都領到相同團隊獎勵的馬可夫賽局。這聽起來簡單,但兩個問題立刻咬上來。第一,智能體通常只憑自己的局部觀測行動、看不到完整狀態,所以必須在資訊不全的情況下協調。第二,由於一個數字獎勵了所有人,智能體無法從那個數字判斷自己的動作到底是幫了忙還是幫倒忙——這就是多智能體的功勞分配問題。

大多數知名的合作式方法,存在的理由正是要破解這兩個問題:集中式訓練、分散式執行讓一個共享評論家在學習時看到全貌,而智能體仍各自局部行動;VDN、QMIX 這類價值分解方法則試圖把團隊價值拆成各智能體的部分。這也是 MARL 在實務上做得最好的設定,從機器人足球到星海爭霸的微操基準都是。

又称
team Markov games