多智能體強化學習

多智能體強化學習中的非平穩性(non-stationarity)

單智能體 RL 倚賴一個安靜的假設:你學習時,環境的規則待在原地不動。在多智能體 RL 裡這個假設崩了,而這個崩壞正是整個領域的招牌難題。從任何一個智能體的角度看,其他智能體都是環境的一部分——而它們也在學,所以環境字面上就在你前進的同時改寫自己的行為。你瞄準的是一個每當你、或任何別人踏出一步就移動的目標。

具體的傷害是:智能體所經歷的轉移與獎勵動態,取決於其他人當前的策略,而這些策略會隨時間改變。這違反了支撐 Q 學習與多數單智能體方法收斂保證的平穩性(固定環境上的馬可夫性質)。一千步前蒐集的經驗,描述的可能是一個已不存在的世界,於是天真的回放可能反而誤導,學習也可能震盪或發散。

沒有免費的解藥,只有種種緩解之道,而把它們點名出來,差不多就把這個領域畫了一半。集中式評論家以其他智能體的動作為條件,使得在那份額外資訊下訊號變得平穩;對手建模試圖預測別人會怎麼變;族群與自我對弈的排程放慢了變動;重要性加權則可把過時的離策略資料降權。認清非平穩性是病根,就等於懂了一半——為什麼 MARL 會被造成現在這個樣子。

又称
moving-target problem