探索
湯普森抽樣(Thompson sampling,在強化學習中)
湯普森抽樣靠著對自己的信念下注來探索。智能體不固定在單一個最佳估計上,而是保有一個機率分布——一個後驗(posterior)——描述每個動作或整個環境可能有多好。要行動時,它從那個後驗抽一個樣本,然後表現得彷彿那個樣本就是真相。它不確定的動作,只要有一個樂觀的樣本落在上面就會被選中,於是不確定性自然驅動了探索。
這個「對抽樣得到的信念貪婪行動」的優雅規則,會自動平衡探索與利用:隨著證據累積,後驗收緊、樣本趨於一致,智能體就安定在真正最好的選項上。實務上它常常追平或勝過 UCB,並在吃角子老虎問題上享有強力的後悔保證。在完整強化學習裡的難處,是當狀態空間龐大時,如何維護並從一個「對價值函數或模型」的後驗中抽樣。
\theta\sim P(\theta\mid \mathcal{D}),\quad a=\arg\max_a Q_\theta(s,a)
從後驗抽一個參數,再彷彿那個樣本正確般貪婪行動。
又称
另见