多智能體強化學習
馬可夫賽局(Markov games)
把馬可夫決策過程——也就是由狀態、動作、獎勵構成的標準單智能體模型——拿來讓好幾個智能體同時行動,得到的就是馬可夫賽局。狀態依然具有馬可夫性質,也就是下一個狀態只取決於當前狀態與此刻所採取的動作,而與完整歷史無關。唯一的改變是:驅動轉移的動作變成所有玩家的聯合動作,而每個玩家各自帶著自己的獎勵函數。
具體來說,馬可夫賽局是一個元組:一組智能體、一個共享的狀態空間、每個智能體各一個動作集合、一條由當前狀態與聯合動作給出下一狀態機率的轉移規則、每個智能體各一個獎勵函數,以及一個折扣因子。當所有智能體共享同一份獎勵時,是合作(團隊)賽局;當兩個智能體的獎勵恰好相反時,是零和賽局;介於兩者之間的一切都是一般和賽局。這一個框架涵蓋了整個領域。
馬可夫賽局之所以是正確的骨幹,是因為它把困難講清楚了:單一智能體無法自己定義「最佳」,因為最好的動作取決於別人怎麼做。於是我們把「最佳策略」這個概念,換成均衡的概念——最著名的就是納許均衡——而我們在單智能體 RL 中享有的許多收斂保證,在這裡會被削弱甚至消失。
\mathcal{G}=\langle \mathcal{N},\mathcal{S},\{\mathcal{A}_i\}_{i\in\mathcal{N}},\,P(s'\mid s,a_1,\dots,a_n),\,\{R_i\}_{i\in\mathcal{N}},\,\gamma\rangle
馬可夫賽局:共享狀態、各智能體各自的動作與獎勵,轉移由聯合動作驅動。
又称
另见