發明出自己語言的智能體
MARL 中最引人注目的結果之一,是溝通不必被設計出來——它可以湧現。給合作的智能體一個共享的通道(比方說幾個離散符號),再給它們一個只能合力解決的任務,它們就會學會用這個通道來協調,並為符號賦予無人寫入的意義。這就是湧現式溝通(emergent communication)。
為什麼會這樣?在合作任務裡,任何能改善協調的東西都會改善共享獎勵,所以最佳化的壓力會發明出一套協定。有了集中式的訓練訊號,梯度甚至能穿過通訊通道,讓說話者學會發出真正有助於聽話者行動的訊息。研究者把這些協定當成研究語言起源本身的模型系統來研究。
未經編排的策略:無人設計的行為
除了語言之外,多智能體情境還以自發、未經編排的策略聞名。在如今已成經典的捉迷藏研究中,由自我對弈在物理世界裡訓練出的智能體,跑出了一連串不斷升級的戰術——尋找者追逐、躲藏者築起堡壘、尋找者抓起斜坡爬進去、躲藏者又把斜坡鎖起來——每一項創新都是對前一項的湧現式回應。沒有任何階段是被編排的;光是競爭,就製造出一場發明的軍備競賽。
這是 MARL 更深層的允諾:學習者之間的互動本身,就是一個開放式的複雜度與課程來源。你設計賽局,而非策略,然後讓智能體來給你驚喜。正是這份生成性,使 MARL 成為研究混合動機社會困境的天然透鏡——合作、背叛、互惠,以及單憑追逐獎勵就湧現出的規範。
未解的難題
MARL 威力強大,卻遠未被解決。剩下的那些難啃的稜角,值得一一點名:
- 可擴展性:當智能體數量變得龐大時,多數理論與許多方法都吃力;真正的「眾智能體」系統(群體、市場)需要全新的想法。
- 泛化:對訓練夥伴表現傑出的智能體,面對全新者時常常失敗——與未曾見過的隊友協調(零樣本協調 zero-shot coordination)大致上仍未解決。
- 非平穩性與穩定性:即使有了 CTDE,在零和或完全合作賽局之外要保證收斂,依舊棘手。
- 獎勵與均衡的選擇:在眾多均衡之中,智能體最終達成哪一個,可能取決於微妙的設計抉擇,而選中的均衡也可能在社會層面上很糟。
欠拟合、良好拟合与过拟合曲线,说明只针对已见对手专门化的智能体为何难以泛化。
這每一項都是一份開放的邀請。進展往往來自把本系列的各條線索揉合在一起——用 CTDE 求穩定、用族群求穩健、用湧現求開放性——而非靠任何單一的妙招。
它連向何處,以及接下來往哪走
MARL 已不再是 RL 中一個小眾的角落。當大型語言模型被串接成多智能體 LLM 系統——規劃者、評論者與工具使用者透過協作編排(orchestration)彼此合作——本系列的這些問題就以新的面貌重新浮現:眾多有能力的智能體該如何協調、分工,並避免互相扯後腿?合作、競爭、信用分配與均衡的這套詞彙,可以直接遷移過去。
图示:大语言模型智能体循环——推理、行动、观察,循环往复。
退一步看,本系列的弧線是一個被深化了的想法:世界充滿了其他心智,而置身其中學習,是一場與獨自學習截然不同的賽局。你已從正式的設定出發,穿過它為何困難,走到合作與競爭的解法,再走出到湧現的前沿。從這裡起,深入任何單一條線索——價值分解、自我對弈聯賽、湧現式溝通——你讀的就是當下正在進行的研究文獻了。
可交互的网格世界:Q 学习智能体通过试错学习每个格子的价值。