多智能體強化學習

反事實多智能體基準線(COMA)

COMA 用一個對每個智能體都很尖銳的問題來處理團隊功勞分配:「正是因為你選了這個動作——相較於你做別的、而其他每個人都做得一模一樣——隊伍究竟好了多少或差了多少?」藉由固定其他智能體的動作、只變動一個智能體的動作,它把那個智能體的個別貢獻從共享獎勵中分離出來。那個差值,就是它的反事實優勢。

機制上它是一個 CTDE 演員–評論家。一個集中式評論家在給定全域狀態下學習聯合動作價值。為智能體 i 減去的基準線,不是單純的狀態價值,而是一個反事實期望:在其他智能體動作固定下,把評論家的價值依智能體 i 當前策略對它所有可能動作取加權平均。用實際聯合價值減去它,得到的優勢只反映智能體 i 的選擇——而且方便的是,這個基準線不依賴智能體 i 實際選的動作,所以不會讓策略梯度產生偏誤。

它的優雅在於:單一個集中式評論家,能同時為每個智能體提供量身打造、個別化的學習訊號,直接回答「在隊伍那樣做的前提下,你這一手好不好」。代價是它需要那個跨聯合動作的集中式評論家,而且在離散動作下最乾淨——因為對一個智能體的替代動作求和很便宜。它至今仍是一座里程碑,示範了反事實推理如何乾淨俐落地解決合作式功勞分配。

A_i(s,\mathbf{a})=Q(s,\mathbf{a})-\sum_{a_i'}\pi_i(a_i'\mid \tau_i)\,Q\big(s,(\mathbf{a}_{-i},a_i')\big)

COMA 的優勢:聯合價值,減去智能體 i 若改採其他動作時的平均期望。

又称
COMAcounterfactual baseline