蒙地卡羅與時間差分學習
最大化偏差(maximization bias)
假設好幾個動作的真實價值其實一樣,但你對每一個都只有帶雜訊的估計。如果你取這些估計的最大值,你幾乎總會挑到一個碰巧被高估的——所以這個最大值系統性地讀起來高於真正的最佳價值。任何「在不確定數字上取最大」的規則都內建了這種往上的扭曲,這就是最大化偏差。
這正是一步 Q-learning 掉進去的陷阱,因為它的目標在帶雜訊的下一狀態動作價值上取最大,灌水了 Q 估計,有時還把策略導向真正比較差、只是看起來好的動作。標準解法是把「選出最好動作」與「替它評價值」這兩件事分開,使用兩個獨立的估計器——這就是雙重 Q-learning 及其深度版本背後的想法。
\mathbb{E}\!\left[\max_i \hat{X}_i\right]\ \ge\ \max_i \mathbb{E}\!\left[\hat{X}_i\right]
帶雜訊估計的最大值,平均而言至少等於它們真實均值的最大值——偏差是往上的。
又称
另见