多智能體強化學習

強化學習中的納許均衡(Nash equilibrium)

當好幾個智能體同時學習時,「學完了」究竟是什麼意思?納許均衡是標準答案:一組策略(每個智能體一個),使得在其他人都不動的前提下,沒有任何單一智能體能靠改變自己的策略變得更好。這是一種彼此都不後悔的狀態——每個人同時都對其他所有人打出最佳回應,於是沒有人有單方面更動的理由。

在馬可夫賽局裡,這取代了單智能體的「最佳策略」概念。每個智能體的策略,在期望報酬的意義下,都必須是對其他人策略的最佳回應;寫出來就是:在其餘智能體策略固定的前提下,智能體 i 的均衡策略所得,至少不亞於任何替代策略。納許證明了在有限賽局中,這樣的均衡(在混合策略下)總是存在,這正是它能作為可用學習目標的原因。

有兩個誠實的提醒,讓它不至於變成萬靈丹。均衡常常不唯一——一個賽局可能有很多個,而學習者可能落在很差的那個——而且納許均衡講的是穩定,不是「好」:智能體可能卡在一個彼此都不利的結果裡(囚徒困境正是如此)。一般而言,計算甚至近似納許均衡都很困難,這也是為什麼許多 MARL 退而求其次,採用較弱、但可學的概念。

J_i(\pi_i^*,\pi_{-i}^*)\;\ge\;J_i(\pi_i,\pi_{-i}^*)\qquad\forall\,\pi_i,\ \forall i

在均衡時,每個智能體 i 的策略都是最佳回應:單方面改變 πᵢ 都無法提高其報酬。

又称
MARL equilibrium