探索

Go-Explore 演算法(Go-Explore)

Go-Explore 建立在一個對「好奇的智能體為何在最難的遊戲上失敗」的直白觀察上:它們一直忘記自己已經找到的有希望的地方。它的解法是維護一個明確的檔案庫(archive),存放智能體抵達過的有趣狀態。每一輪它挑一個記住的狀態,直接回到那裡——靠重播路徑或重置模擬器——然後才從那個前沿往外探索,把任何新發現的狀態存回檔案庫。

把「記住並返回」和「探索」分開是關鍵。多數探索方法是邊探索邊學習,而學習的雜訊會讓它們從辛苦掙來的進展上漂走,這種失敗叫脫軌(derailment);Go-Explore 拒絕遺忘,所以能在探索之上再疊探索。這讓它在《蒙提祖瑪的復仇》與《Pitfall》上打破紀錄。之後的一個強健化(robustification)階段,把發現的軌跡轉成一個可靠、耐雜訊的策略。

又称
Go-Explore algorithm