JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

當一個智能體不夠用時

從單一學習者走向充滿學習者的世界,並認識正式的架構:馬可夫賽局,以及合作—競爭—混合的光譜。

世界很少為了一個學習者而靜止不動

傳統的強化學習講的是一個乾淨的故事:單一智能體在環境中行動,世界給出回應,再由獎勵引導學習。但看看我們真正在意的問題——車流中匯入的車輛、足球場上的球員、拍賣中的競標者、彼此穿梭的倉儲機器人。在這些情境裡,「環境」有一部分是由其他學習者組成的,每一個都在追逐自己的目標。這就是多智能體強化學習(multi-agent reinforcement learning, MARL)的領域。

正文所述的经典单智能体循环:一个智能体行动,环境以新状态和奖励作出回应。

智能体—环境循环示意图:智能体发出动作,环境返回下一个状态和奖励。

這個轉變比「更多智能體」要深刻得多。一旦兩個學習者共處一個世界,每一個的最佳行動都取決於其他者在做什麼——而其他者所做的事,又會隨著它們同樣在學習而不斷改變。你腳下的地面不再固定。光是這個事實,就重塑了幾乎一切,也正是 MARL 既迷人又真正困難的原因。

正式架構:從 MDP 到馬可夫賽局

單智能體 RL 建立在 馬可夫決策過程(Markov Decision Process, MDP)之上:狀態、動作、轉移、獎勵。多智能體 RL 把它推廣為馬可夫賽局(Markov game,又稱隨機賽局 stochastic game)。現在有 N 個智能體。在每個狀態下,每個智能體各自選一個動作;環境根據所有人的聯合動作轉移到新狀態;而每個智能體領到的是自己的獎勵。

有兩個變化承載了全部的重量。第一,轉移取決於聯合動作,而非單一智能體的動作——因此沒有任何一個智能體能完全掌控結果。第二,每個智能體有自己的獎勵函數,所以它們的目標可以一致、衝突,或介於兩者之間。一個普通的 MDP,只是馬可夫賽局在單一智能體時的特例。

\mathcal{P}\!\left(s' \mid s, a_1, \dots, a_n\right) \qquad r_i\!\left(s, a_1, \dots, a_n\right)

马尔可夫博弈带来的两点变化:状态转移和每个智能体的奖励都取决于所有智能体的联合动作。

三種風味:合作、競爭,或兩者兼具

智能體之間獎勵的關聯方式,把 MARL 分成三大類。在合作式 MARL中,每個人共享(或幾近共享)同一份獎勵——例如一支救援隊、一群送貨無人機、一座平衡負載的電網。成功是集體的;挑戰在於協調。

競爭式 MARL中,一個智能體的獲益就是另一個的損失——這是棋類、格鬥遊戲與追逃問題的零和世界。在這裡對手正積極地想擊敗你,所以進步意味著要勝過一個會移動的對手。多數真實系統落在中間地帶:混合合作—競爭情境,例如團隊運動(與隊友合作、與對手競爭)或市場(交易者共享基礎設施,卻又彼此爭奪利潤)。

  1. 問:智能體共享獎勵嗎?若是 → 合作式。
  2. 一方的獲益是否等於另一方的損失?若是 → 競爭式(通常為零和)。
  3. 是否兩者兼有、也許還分成隊伍?那就是混合式——最常見、也最困難。

現在「最優」究竟是什麼意思?

在單智能體 RL 裡有個乾淨的目標:使期望獎勵最大化的最優策略。但當有多個各懷私心的學習者時,這個想法就垮了。你的最佳策略取決於它們的,而它們的又取決於你的。標準的替代方案借自賽局理論:納許均衡(Nash equilibrium)——一組策略,在其中沒有任何單一智能體能在其他人都不動的情況下,靠單方面改變自己的策略而變得更好。

納許均衡是一種彼此的最佳回應:在給定其他人作為的前提下,每個人都已做到最好。它是 MARL 的基石概念——但也很滑溜。均衡可能有很多個、可能難以達成,而且「沒有人能單獨改善」並不總是代表「這對每個人都好」。這些麻煩,我們下一篇就來拆解。

J_i\!\left(\pi_i^{*}, \pi_{-i}^{*}\right) \;\ge\; J_i\!\left(\pi_i, \pi_{-i}^{*}\right) \quad \forall\, \pi_i,\ \forall\, i

作为相互最优反应的纳什均衡:在其他智能体策略不变时,没有智能体能通过改变自身策略获得更高收益。