探索
信賴上界(upper confidence bound,UCB)
UCB 把樂觀變得精確。對每個動作,它加總兩樣東西:該動作的估計價值,再加上一個獎勵項,這個獎勵在動作只被試過幾次時很大、隨證據累積而縮小。智能體接著就單純挑出總和最高的動作。早期獎勵項主導,驅使智能體把每個動作都抽樣一遍;後期價值主導,它就利用真正最好的那個。
那個獎勵項是價值的一個信賴區間上界——大致是說,鑑於我們對這個動作看得這麼少,它合理上最好能有多好。藉著總是選出「合理價值最高」的動作,UCB 剛好在它可能出錯的地方探索,一旦有了把握就停下。在吃角子老虎(bandit)設定下,這替它贏得緊緻、近乎最佳的後悔(regret)保證;要把它延伸到狀態空間龐大的完整強化學習則困難得多,這正是基於計數與偽計數的獎勵試圖近似的東西。
a_t=\arg\max_a\left[Q(s,a)+c\sqrt{\frac{\ln t}{N(s,a)}}\right]
挑出「價值加探索獎勵」最大的動作;獎勵會隨造訪計數 N 增加而淡去。
又称
另见