多智能體強化學習
競爭式多智能體強化學習(competitive multi-agent RL)
競爭式 MARL 是比賽的世界:我之所得即你之所失。最乾淨的情形是雙人零和賽局,像西洋棋、圍棋或撲克,兩邊的獎勵加總為零——一方贏多少,另一方就輸同樣多。在這裡協調沒有意義;整個任務就是找出一套策略,能撐住一個同樣拼命想擊敗你的對手。
數學上,這是一個獎勵函數相互對立的馬可夫賽局,自然的目標是極小化極大(minimax):假設對手會把你的報酬壓到最低,你就要在這前提下把自己的報酬拉到最高。相應的解是極小化極大(鞍點)均衡,在雙人零和賽局中它與納許均衡一致,而且關鍵是——保證存在。正是這個保證,讓競爭式設定在理論上比一般和設定更乾淨。
競爭式 MARL 在實務上的引擎是自我對弈:智能體靠對戰自己的副本或過去版本來進步,隨著自己變強而不斷把難度往上推。AlphaGo、AlphaZero,以及撲克與星海爭霸的系統,都是這樣達到超越人類的水準。要當心的風險是過度擬合自己的怪癖——打贏昨天的自己,跟打贏一個真正不同的對手,並不是同一回事。
又称
另见