面對不確定時保持樂觀
探索中最具生產力的單一想法,就是 面對不確定時的樂觀(optimism in the face of uncertainty)。規則是:當你不確定某個動作有多好時,就假設它很好並去試。如果它真的好,你就賺到;如果不好,你會很快發現並停手——你的樂觀會自我修正。關鍵在於,樂觀是有方向的:它把智慧體精準地推向它最不了解的事物,而非推向隨機雜訊。
把它和上一篇的 無方向方法對比:ε-greedy 是盲目探索;樂觀則是因為不確定而探索。正是這一點改變,讓下面的方法能在 拉霸機上獲得可證明的保證。
UCB:對「不確定」發放紅利
信賴上界(Upper Confidence Bound, UCB) 把樂觀具體化。為每個動作維護兩個數字:它的估計平均價值,以及一個會隨嘗試次數增加而縮小的 信賴紅利(confidence bonus)。然後對平均 + 紅利這個樂觀估計做貪婪選擇——幾乎沒試過的動作帶著很大的紅利,因此即使目前平均普通也會勝出;一旦試得夠多,紅利消退,就由真正的平均來決定。
# UCB1 for a bandit: pick the arm with the highest optimistic value
for each arm a:
bonus[a] = c * sqrt( ln(total_pulls) / pulls[a] )
ucb[a] = mean_reward[a] + bonus[a]
return argmax(ucb) # try fewer-pulled arms while their bonus is largeUCB1:选择估计价值加上置信奖励之和最大的动作;该奖励对很少尝试的动作较大,并随 ln(t)/N(a) 收缩。
Thompson 抽樣:對信念下注
Thompson 抽樣 以另一條不同卻優美簡潔的路徑達到相同目標,根植於 貝氏(Bayesian)思維。它不維護單一價值估計,而是為每個動作的真實價值維護一個機率分布(你的 後驗(posterior) 信念)。行動時:從每個動作的分布各抽一個隨機樣本,再選樣本最高的那個動作。
交互组件:先验分布在观测到新数据后更新为更尖锐的后验分布。
這會自動處理探索。你不確定的動作有寬的分布,因此它的樣本有時會非常高——於是被選中、被嘗試。你確信很差的動作則有一個位置偏低的窄分布,幾乎永遠贏不了。隨著證據累積,每個分布都會收窄,策略最終落在真正最好的動作上。這種隨機性是與你的不確定性成正比——正是我們想要的有方向行為。
對整個 MDP 做後驗抽樣
把 Thompson 的想法從單一動作擴展到整個環境,就得到 強化學習的後驗抽樣(posterior sampling for RL, PSRL)。它維護的後驗不是關於動作價值,而是關於整個世界模型——轉移與獎勵動態。每個回合開始時,從該後驗抽出一個完整、合理的 MDP,把它當成真相去求解,並在這個回合中遵循那個策略。再用觀察到的結果更新後驗,下一回合重新抽樣。
交互式马尔可夫链:状态之间由转移概率连接,表示一个采样得到的环境模型。
資訊增益:為了學習而探索
第三種視角把目標講得更明白:資訊增益探索(information-gain exploration)。在這裡,智慧體看重一個動作,一部分是因為它帶來的獎勵,另一部分是因為預期能學到多少——也就是它能把自己對世界的不確定性削減多少。形式上,這份學習量度為後驗熵的預期下降量。這個觀點統一了其他方法:樂觀與 Thompson 抽樣都可解讀為「在你能學最多之處行動」的高效、可計算的近似。
這三個原則——樂觀、後驗抽樣、資訊增益——是理論基石。其餘篇章主要在談當狀態多到數不清時,如何估計不確定性,而那正是深度強化學習所在之處。