多智能體強化學習

虛擬自我對弈(fictitious self-play)

虛擬自我對弈修補了純自我對弈的一個特定弱點:只追逐最新的自己,會讓你繞圈打轉,就像一個學會打贏剪刀、卻又輸給回頭的石頭的智能體。解法是別再只對最近一個對手打最佳回應,而是對你曾遭遇過的所有對手之平均打最佳回應。藉由瞄準歷史的混合、而非那個移動中的尖端,學習會被穩定地拉向均衡,而不是繞著它轉。

它源自虛擬對弈(fictitious play),一個經典的賽局理論程序:每位玩家假設對手會打出其過去動作的經驗平均,然後打出最佳回應,而這些跑動的平均,在重要的賽局類別(如雙人零和)中被證明會收斂到納許均衡。虛擬自我對弈是它在現代強化學習中的實現——最佳回應由 RL 學得,而「平均策略」則用一個被訓練去模仿智能體自身過去最佳回應的網路來近似。

這個平均化的想法,是強大對弈系統的骨幹,最著名的就在撲克:神經虛擬自我對弈及其後繼者,在不完全資訊賽局中達到接近均衡的水準。代價是:維護並學習一個平均策略,比起天真的自我對弈增加了機制、也慢了些,而且收斂保證只在受限的賽局類別中乾淨成立——但它換來的穩定,通常是值得的。

\pi_{t+1}\in \text{BR}\!\left(\bar{\sigma}_t\right),\qquad \bar{\sigma}_{t+1}=\big(1-\tfrac{1}{t+1}\big)\bar{\sigma}_t+\tfrac{1}{t+1}\pi_{t+1}

對過去打法的滑動平均打最佳回應,再把新回應併回那個平均裡。

又称
FSPfictitious play