多智能體強化學習
族群式訓練(population-based training)
族群式訓練不是訓練一個智能體,而是同時訓練一整群,並讓它們從彼此的際遇中學習。每個成員用自己的超參數跑自己的 RL;每隔一段時間,族群會盤點一次,表現差的去複製表現好的成員的權重與設定,而那些被複製來的設定接著會被隨機擾動,以探索鄰近區域。它把一般的學習(每個智能體內部的梯度步)與演化(跨智能體的選擇與突變)揉合在一起。
這首先換來的,是在單次訓練過程中自動調超參數:不需要另外做昂貴的掃描,因為學習率、熵獎勵、獎勵權重等等,本身就在線上演化,表現好的組合會在族群中擴散開來。其次——也是它出現在本章的原因——這個族群同時兼作自我對弈的多樣對手池:一個內建的多樣對手供應源,足以抵抗單線自我對弈的循環與過度擬合。
族群式訓練是 AlphaStar 的星海爭霸 II 智能體、以及《雷神之鎚》奪旗工作的核心,正是因為多樣的族群既能自我調參、又能產出穩健、難被剝削的策略。代價是算力:你同時在跑許多智能體,所以遠比單次訓練更吃資源,而演化的部分也增加了記帳負擔。在算力充裕之處,它是一個出奇有效、近乎免費地換來穩健與調參的辦法。
又称
另见