多智能體強化學習
多智能體強化學習(multi-agent reinforcement learning)
想像一個繁忙的十字路口,每台車都是自己的學習者,各自想更快回家,又各自對別人的動作做出反應。這就是多智能體強化學習的世界:不再是一個智能體面對固定的環境,而是好幾個智能體共享同一個世界,於是某個智能體動作的後果,取決於同一時刻其他人選了什麼。交通、市場、團隊運動、機器人群、撲克或星海爭霸這類賽局,都是用它來建模的。
嚴格地說,每個智能體都有自己的觀測、自己的動作集合、自己的獎勵。麻煩在於:環境的下一個狀態取決於所有智能體當下的聯合動作,所以從任何單一智能體的角度看,遊戲規則會隨著其他人學習而不斷漂移。這裡研究的對象主要是馬可夫賽局(又稱隨機賽局),而解的概念來自賽局理論,而非單一的最佳策略。
MARL 很強大,但確實比單智能體 RL 難得多,原因有三、而且貫穿整個領域:環境是非平穩的,因為大家同時在學;聯合動作空間隨智能體數量指數級膨脹;當一支隊伍共享一份獎勵時,很難判斷究竟是哪個智能體真正掙來的。這裡幾乎每個技巧,都是對這三個問題之一的回答。
又稱
另見