面對不確定時保持樂觀
探索中最具生產力的單一想法,就是 面對不確定時的樂觀(optimism in the face of uncertainty)。規則是:當你不確定某個動作有多好時,就假設它很好並去試。如果它真的好,你就賺到;如果不好,你會很快發現並停手——你的樂觀會自我修正。關鍵在於,樂觀是有方向的:它把智慧體精準地推向它最不了解的事物,而非推向隨機雜訊。
把它和上一篇的 無方向方法對比:ε-greedy 是盲目探索;樂觀則是因為不確定而探索。正是這一點改變,讓下面的方法能在 拉霸機上獲得可證明的保證。
UCB:對「不確定」發放紅利
信賴上界(Upper Confidence Bound, UCB) 把樂觀具體化。為每個動作維護兩個數字:它的估計平均價值,以及一個會隨嘗試次數增加而縮小的 信賴紅利(confidence bonus)。然後對平均 + 紅利這個樂觀估計做貪婪選擇——幾乎沒試過的動作帶著很大的紅利,因此即使目前平均普通也會勝出;一旦試得夠多,紅利消退,就由真正的平均來決定。
# UCB1 for a bandit: pick the arm with the highest optimistic value
for each arm a:
bonus[a] = c * sqrt( ln(total_pulls) / pulls[a] )
ucb[a] = mean_reward[a] + bonus[a]
return argmax(ucb) # try fewer-pulled arms while their bonus is largeUCB1:選擇估計價值加上置信獎勵之和最大的動作;該獎勵對很少嘗試的動作較大,並隨 ln(t)/N(a) 收縮。
Thompson 抽樣:對信念下注
Thompson 抽樣 以另一條不同卻優美簡潔的路徑達到相同目標,根植於 貝氏(Bayesian)思維。它不維護單一價值估計,而是為每個動作的真實價值維護一個機率分布(你的 後驗(posterior) 信念)。行動時:從每個動作的分布各抽一個隨機樣本,再選樣本最高的那個動作。
互動元件:先驗分佈在觀測到新資料後更新為更尖銳的後驗分佈。
這會自動處理探索。你不確定的動作有寬的分布,因此它的樣本有時會非常高——於是被選中、被嘗試。你確信很差的動作則有一個位置偏低的窄分布,幾乎永遠贏不了。隨著證據累積,每個分布都會收窄,策略最終落在真正最好的動作上。這種隨機性是與你的不確定性成正比——正是我們想要的有方向行為。
對整個 MDP 做後驗抽樣
把 Thompson 的想法從單一動作擴展到整個環境,就得到 強化學習的後驗抽樣(posterior sampling for RL, PSRL)。它維護的後驗不是關於動作價值,而是關於整個世界模型——轉移與獎勵動態。每個回合開始時,從該後驗抽出一個完整、合理的 MDP,把它當成真相去求解,並在這個回合中遵循那個策略。再用觀察到的結果更新後驗,下一回合重新抽樣。
互動式馬可夫鏈:狀態之間由轉移機率連接,表示一個取樣得到的環境模型。
資訊增益:為了學習而探索
第三種視角把目標講得更明白:資訊增益探索(information-gain exploration)。在這裡,智慧體看重一個動作,一部分是因為它帶來的獎勵,另一部分是因為預期能學到多少——也就是它能把自己對世界的不確定性削減多少。形式上,這份學習量度為後驗熵的預期下降量。這個觀點統一了其他方法:樂觀與 Thompson 抽樣都可解讀為「在你能學最多之處行動」的高效、可計算的近似。
這三個原則——樂觀、後驗抽樣、資訊增益——是理論基石。其餘篇章主要在談當狀態多到數不清時,如何估計不確定性,而那正是深度強化學習所在之處。