多智能體強化學習
QMIX 與單調混合(QMIX and monotonic mixing)
QMIX 是 VDN 之後自然的下一步。它保留了分散式執行的夢想,卻把僵硬的「直接相加」規則換成更有表達力的東西:一個學得的混合網路,透過任何對每個智能體價值都單調遞增的函數,把各智能體的價值組合成團隊價值。於是團隊價值可以用豐富、非線性的方式依賴各智能體——只要讓任何一個智能體的價值上升,永遠不會讓團隊價值下降。
為什麼非要單調不可?因為這正是讓分散式貪婪動作保持正確的條件。若混合對每個智能體價值都單調,那麼最大化團隊價值的聯合動作,正好就是每個智能體各自獨立最大化自己價值的那一個——和 VDN 一樣美妙的性質,但這次不必逼組合方式變成單純的總和。混合網路的權重本身,是由一個小型超網路從全域狀態產生的,於是情境可以重新塑造這個混合。
QMIX 成了星海爭霸多智能體挑戰賽等合作式基準上的預設強基準,在智能體價值會交互作用時明顯勝過 VDN。但它的邊界依然真實:單調混合無法表示那些最佳協調本質上非單調的任務——在那裡,某個智能體有時必須為了團隊犧牲自己的價值。後來的方法(QTRAN、加權 QMIX、QPLEX)以額外的複雜度為代價,突破了這道天花板。
\frac{\partial Q_{\text{tot}}}{\partial Q_i}\ge 0\quad\forall i\ \Longrightarrow\ \arg\max_{\mathbf{a}}Q_{\text{tot}}=\big(\arg\max_{a_i}Q_i\big)_{i=1}^{n}
對每個 Qᵢ 的單調性,保證各智能體各自的貪婪動作合起來能最大化團隊價值。
又稱
另見