探索
基於計數的探索(count-based exploration)
這是鼓勵好奇心最直觀的方式之一:記下智能體造訪每個狀態的次數,並為造訪那些很少看過的狀態發放一份獎勵。新奇的狀態會發亮,熟悉的狀態則黯淡。把這份獎勵加到真實獎勵上,就悄悄把智能體「最大化價值」的衝動,轉成「去尋找世界中陌生角落」的衝動。
這份獎勵通常按造訪計數平方根的倒數縮放,呼應 UCB 的信賴項,所以很少看過的狀態強烈吸引人,被踏遍的狀態則否。在一個小而離散的世界裡,這運作得很漂亮,還有理論撐腰。但一旦狀態是影像或連續向量,它立刻失效,因為那時幾乎每個狀態都只被造訪剛好一次,計數帶不出任何訊號——這正是偽計數被發明出來要解決的問題。
r^{+}(s)=r(s)+\frac{\beta}{\sqrt{N(s)}}
把真實獎勵加上一份隨造訪計數 N(s) 上升而衰減的獎勵。
又稱
另見