JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

樂觀與後驗:UCB 與 Thompson 抽樣

兩種有原則的有方向探索引擎:對未知保持樂觀,或把你信念中抽出的一個樣本當成真。

面對不確定時保持樂觀

探索中最具生產力的單一想法,就是 面對不確定時的樂觀(optimism in the face of uncertainty)。規則是:當你不確定某個動作有多好時,就假設它很好並去試。如果它真的好,你就賺到;如果不好,你會很快發現並停手——你的樂觀會自我修正。關鍵在於,樂觀是有方向的:它把智慧體精準地推向它最不了解的事物,而非推向隨機雜訊。

把它和上一篇的 無方向方法對比:ε-greedy 是盲目探索;樂觀則是因為不確定而探索。正是這一點改變,讓下面的方法能在 拉霸機上獲得可證明的保證。

UCB:對「不確定」發放紅利

信賴上界(Upper Confidence Bound, UCB) 把樂觀具體化。為每個動作維護兩個數字:它的估計平均價值,以及一個會隨嘗試次數增加而縮小的 信賴紅利(confidence bonus)。然後對平均 + 紅利這個樂觀估計做貪婪選擇——幾乎沒試過的動作帶著很大的紅利,因此即使目前平均普通也會勝出;一旦試得夠多,紅利消退,就由真正的平均來決定。

# UCB1 for a bandit: pick the arm with the highest optimistic value
for each arm a:
    bonus[a] = c * sqrt( ln(total_pulls) / pulls[a] )
    ucb[a]   = mean_reward[a] + bonus[a]
return argmax(ucb)   # try fewer-pulled arms while their bonus is large
UCB1:紅利會在很少被拉的臂上變大,並以 ln(t)/n 的速率縮小。
a_t = \arg\max_a \left[ \hat{Q}(a) + c\sqrt{\dfrac{\ln t}{N(a)}} \right]

UCB1:選擇估計價值加上置信獎勵之和最大的動作;該獎勵對很少嘗試的動作較大,並隨 ln(t)/N(a) 收縮。

Thompson 抽樣:對信念下注

Thompson 抽樣 以另一條不同卻優美簡潔的路徑達到相同目標,根植於 貝氏(Bayesian)思維。它不維護單一價值估計,而是為每個動作的真實價值維護一個機率分布(你的 後驗(posterior) 信念)。行動時:從每個動作的分布各抽一個隨機樣本,再選樣本最高的那個動作。

湯普森取樣為每個動作的價值維護一個後驗分佈;這個貝氏更新元件展示了隨著證據累積,信念如何變得更確定。

互動元件:先驗分佈在觀測到新資料後更新為更尖銳的後驗分佈。

這會自動處理探索。你不確定的動作有寬的分布,因此它的樣本有時會非常高——於是被選中、被嘗試。你確信很差的動作則有一個位置偏低的窄分布,幾乎永遠贏不了。隨著證據累積,每個分布都會收窄,策略最終落在真正最好的動作上。這種隨機性是與你的不確定性成正比——正是我們想要的有方向行為。

對整個 MDP 做後驗抽樣

把 Thompson 的想法從單一動作擴展到整個環境,就得到 強化學習的後驗抽樣(posterior sampling for RL, PSRL)。它維護的後驗不是關於動作價值,而是關於整個世界模型——轉移與獎勵動態。每個回合開始時,從該後驗抽出一個完整、合理的 MDP,把它當成真相去求解,並在這個回合中遵循那個策略。再用觀察到的結果更新後驗,下一回合重新抽樣。

後驗取樣每個回合取樣一個完整的環境模型;這個互動式馬可夫鏈展示了「環境模型」——由轉移機率連接的狀態——究竟是什麼樣子。

互動式馬可夫鏈:狀態之間由轉移機率連接,表示一個取樣得到的環境模型。

資訊增益:為了學習而探索

第三種視角把目標講得更明白:資訊增益探索(information-gain exploration)。在這裡,智慧體看重一個動作,一部分是因為它帶來的獎勵,另一部分是因為預期能學到多少——也就是它能把自己對世界的不確定性削減多少。形式上,這份學習量度為後驗熵的預期下降量。這個觀點統一了其他方法:樂觀與 Thompson 抽樣都可解讀為「在你能學最多之處行動」的高效、可計算的近似。

這三個原則——樂觀、後驗抽樣、資訊增益——是理論基石。其餘篇章主要在談當狀態多到數不清時,如何估計不確定性,而那正是深度強化學習所在之處。