強化學習理論
探索–後悔取捨(exploration–regret tradeoff)
要知道什麼好,智能體有時必須去試它目前認為不好的動作——這就是探索,而它當下就要付出報酬代價。但從不探索就永遠發現不了更好的東西存在,那會永遠損失報酬。探索–後悔的取捨就是這兩者之間的張力:每一步探索,都是為了更大的未來收益,刻意先付下的一小筆後悔頭期款。
理論顯示這筆頭期款無可避免,並把它量化。在多臂吃角子老虎中,要把最佳臂和幾乎打平的臂分開,所需的拉桿次數與兩者差距的平方成反比,因此任何好演算法付的後悔大約是各臂 (log T)/差距 的總和。基於樂觀的方法(UCB、UCRL)與後驗抽樣(湯普森抽樣)的設計,正是花剛好足夠的探索讓總後悔維持次線性,同時不過度探索。
這個平衡很微妙且依問題而定:探索太少有鎖死在錯誤選擇、招致線性後悔的風險;太多則在已成定局的問題上浪費報酬。好的演算法會隨證據累積自動讓探索率縮小。
\mathrm{Regret}(T)\ \approx\ \sum_{a:\Delta_a>0}\frac{\log T}{\Delta_a}
吃角子老虎的後悔隨時間對數成長,但與每個動作的最優差距 Δ 成反比。
另見