多智能體強化學習
價值分解網路(value decomposition networks)
價值分解網路用一個乾淨、近乎天真的想法來攻克合作式功勞分配:假設團隊的聯合價值就只是各智能體各一份價值的總和。每個智能體從自己的觀測學自己的局部動作價值,把它們加起來就得到團隊價值。因為團隊獎勵訓練的是這個總和,每個智能體那一份都會被推往對整體有利的方向——一個共享的數字,就這樣被輕柔地拆成各自的責任。
這種可加結構的好處,是免費換來分散式執行。要讓團隊貪婪地行動,你會想最大化聯合價值;但若聯合價值是各智能體項的總和,那麼每個智能體只要各自獨立最大化自己那一項,整體就自動在貪婪行動。於是一個集中的總和訓練了各部分,而每個智能體在執行時各自決定——正是 CTDE 的教科書範例。
誠實的限制是:真實的隊伍未必總是可加的;有時兩個智能體的價值會交互作用,好的聯合行為無法寫成單純的總和。VDN 無法表示這種耦合,會誤判這類情況。正是這個缺點催生了 QMIX:它保留了執行時的可分散性,卻允許各智能體價值用更豐富的單調(而非僅僅可加)方式組合。
Q_{\text{tot}}(\boldsymbol{\tau},\mathbf{a})=\sum_{i=1}^{n} Q_i(\tau_i,a_i)
VDN 把團隊價值分解成各智能體價值之和,於是「各自貪婪」就等於「團隊貪婪」。
又称
另见