探索
強化學習的後驗抽樣(posterior sampling for RL,PSRL)
後驗抽樣是把湯普森抽樣從單一動作提升到整個環境。智能體持有一個「對自己可能身處哪個 MDP」的後驗分布——對未知的轉移與獎勵動態的分布。在每個回合開始時,它從那個後驗抽出一個完整的 MDP,把它當成必定為真來求解,並在整個回合中遵循那個最佳策略,直到下一回合才再抽一次。
在整個回合中堅守一個抽樣得到的世界,正是 PSRL 力量的來源:策略在內部是一致的,會追求一個連貫的計畫,產生深入、有方向的探索,而不是逐步隨機帶來的猶疑。這讓它在「需要長串有目的動作」的問題上,遠比 epsilon-貪婪有效率,也帶有已知最佳的後悔界之一——不過每個回合都要抽樣並求解一個 MDP,計算上很吃重。
又称
另见