多智能體強化學習

自我對弈訓練(self-play training)

自我對弈是 RL 一些最著名勝利背後那個看似簡單的想法:想把一個遊戲玩好,就跟自己對打。智能體不必有一整套人類對手,而是靠對戰自己的副本或較早的版本,自己生出訓練用的對手。隨著它變強,對手也跟著變強,於是挑戰會自動調節到剛好夠難——一套靠自己拉自己上去的內建課程。

其機制是一個迴圈:當前策略和自己(或自己過去檢查點構成的池子)對局,這些對局成為訓練資料,策略隨之進步,而更強的新策略又成為下一個對手。在雙人零和賽局中,這個過程會自然被拉向極小化極大均衡;結合搜尋與深度網路,它造就了 AlphaGo、AlphaZero,以及在撲克、Dota、星海爭霸中超越人類的水準。

它著名的失敗模式是循環與對自己過度擬合。智能體可能學會擊敗當前的自己,卻悄悄忘了如何應付更舊的策略,導致像剪刀石頭布那樣的循環——進展繞圈而非向上。標準的防範是持續對戰一個多樣的過去對手池,並摻入平均化的策略——而這正是虛擬自我對弈與族群式方法的用途。

又称
self-play