多智能體強化學習

混合合作–競爭設定(mixed cooperative–competitive settings)

大多數有趣的多智能體情境,既不是純合作、也不是純對抗——而是兩者同時存在。在五人制足球賽裡,你的四個隊友與你目標一致,對方那隊則與之為敵;在市場上,賣家既合作以維持市場活絡,又為每一位顧客彼此競爭。這些混合設定,形式上就是一般和馬可夫賽局,是團隊合作與對抗交織在一起的地方。

在這裡,智能體得同時做兩件事:與獎勵和自己一致的盟友協調,並算計獎勵與自己衝突的對手。沒有單一共享目標可優化,也沒有漂亮的零和結構可利用,於是合作的技巧與競爭的技巧都只能用上一半。相應的解概念是一般和均衡,它可能不唯一,甚至連計算都很困難。

由於一般和賽局缺少零和情形那種強保證,這是 MARL 中最貼近現實、卻也最脆弱的部分。均衡可能有多個且效率低落,智能體可能陷入互相傷害的模式,學習也可能永遠安定不下來。多智能體粒子環境與團隊型電玩這類基準之所以流行,正是因為它們逼演算法在同一口氣裡同時處理合作與競爭。

又称
general-sum gamesteam-vs-team settings