探索
隨機網路蒸餾(random network distillation,RND)
RND 是一個出奇簡單的衡量新奇性的方法。固定一個隨機初始化的神經網路、永遠不訓練它——它把每個狀態映射到某個任意但固定的向量。然後訓練第二個網路,用智能體實際造訪過的狀態去模仿第一個。在常看到的狀態上,模仿者吻合得很好;在一個全新、沒造訪過的狀態上,它根本沒機會練習,所以誤差很大。那個誤差就是新奇性獎勵。
因為目標是狀態的一個確定性函數,沒有任何固有隨機性可供預測者去追——它繞過了困擾前向模型好奇心的雜訊電視問題,因為預測誤差只可能來自不熟悉,而非來自隨機動態。便宜、穩定、又容易加上,RND 幫助促成了在像《蒙提祖瑪的復仇》(Montezuma's Revenge)這類困難探索遊戲上最早的幾個強力成果。
r^{i}_t=\lVert \hat{f}(s_t)-f(s_t)\rVert^{2}
新奇性是受訓預測器與一個固定隨機目標網路在當前狀態上的誤差。
又称
另见