強化學習理論

集中界(concentration bounds)

當你用有限筆帶雜訊的樣本平均來估一個值,你的估計可能偏離真值多遠?集中界以高機率的尾端保證回答這件事:它說除了一個機率極小的壞事件外,平均值都落在某個逐漸縮小的窗內。它是把「我們蒐集了 n 筆樣本」轉成「我們的價值估計精確到 ε 之內」的統計黏著劑。

霍夫丁(Hoeffding)與伯恩斯坦(Bernstein)不等式是主力;誤差通常隨樣本數的平方根倒數縮小,而當變異很小時伯恩斯坦會把它收得更緊。在強化學習中,這些界逐一套用在每個狀態–動作對上以控制報酬與轉移的估計,再透過貝爾曼方程往外傳播。對全部 S×A 對取聯集界會加上一個對數代價,這就是樣本複雜度結果帶有 log(SA/δ) 因子的原因。

若天真地各自界定每個值再相加會很鬆;現代分析改用變異感知(伯恩斯坦式)與總變異論證,以免把視界因子重複付好幾次,這正是最緊的視界依賴得以還原的方法。

\Pr\!\big(|\hat\mu-\mu|\ge\varepsilon\big)\le 2\exp(-2n\varepsilon^{2})

霍夫丁不等式:估計誤差的尾端隨樣本數 n 指數衰減。

又称
Hoeffding boundBernstein bound