回報是一個隨機變數
古典的價值函數回報單一數字:從某狀態出發的期望回報。但回報確實是隨機的——同一狀態可能因隨機動態與策略選擇而通往大獎或災難。分布式強化學習學習回報的整個分布 Z(s,a),而非僅其均值 Q(s,a) = E[Z],並以一個分布式貝爾曼方程取代普通的貝爾曼方程,在隨機獎勵與折扣後的下一狀態分布下更新整個分布。
實務問題是如何表示分布。兩種答案占主導:類別式固定一組回報值網格並在其上學習機率(C51 演算法,透過把貝爾曼目標投影回網格、最小化交叉熵來訓練);分位數式固定機率、學習各分位數處的回報值(以分位數迴歸損失訓練)。分位數觀點通常更受青睞,因為它繞開了那個棘手的投影步驟。
分布式贝尔曼方程:回报 Z 是一个随机变量,其分布等于奖励加上折扣后的下一状态回报。
為何建模分布有助益
如果你終究只依均值行動,何必背負整個分布?經驗上,分布式智能體就是學到更好的表徵:匹配完整分布是更豐富、更嚴苛的預測目標,迫使網路編碼更多關於動態的資訊。除此之外,分布還解鎖了風險敏感控制(最佳化條件風險值而非均值)與更好的探索(Z 的散布是對某狀態—動作不確定性的訊號)。
學習模型並在想像中規劃
基於模型的強化學習學習環境的動態——預測下一狀態與獎勵——再利用該模型在不接觸真實環境的情況下產生額外經驗。它的承諾是樣本效率:一個昂貴的真實步可孕育許多廉價的想像步。它的危險是模型誤差:學到的模型是錯的,而長推演會把這些誤差累積,直到智能體在對抗一個幻覺。
学习得到的动力学模型预测下一状态和奖励,使智能体无需接触真实环境即可生成想象中的经验。
基於模型的策略最佳化(MBPO)是乾淨的化解之道。它不信任冗長的想像軌跡,而是產生短而分支的推演:從回放緩衝抽取的真實狀態出發,僅用模型向前滾動寥寥數步,再以真實與想像資料的混合訓練一個離策略學習器(如 SAC)。其支撐理論以模型誤差與推演長度為項界定策略真實價值的落差——明確說明為何讓推演保持簡短能把偏差控制住。
- 對真實經驗緩衝擬合一組單步動態模型集成(集成標示出模型不確定之處)。
- 採樣真實起始狀態;用模型向前滾動 k 個短步以合成轉移。
- 以離策略演算法在真實+想像資料上訓練策略與評論者。
- 初期讓 k 維持很小,僅在模型證明可靠後才增長它。
搜尋即規劃——MCTS
當你擁有模型——或一場遊戲的真實規則——你便能在決策時向前看以做規劃。蒙地卡羅樹搜尋(MCTS)透過四個反覆的階段逐步建構搜尋樹:以一條上信賴界規則選擇有希望的路徑,平衡節點的估計價值與它被造訪的稀少程度;擴展一個新葉節點;評估它(透過推演或學習得到的價值網路);並把結果回溯以更新沿路的價值估計。歷經多次迭代,樹把心力集中在最有希望的路線上。
交互式蒙特卡洛树搜索,通过选择与回传逐节点构建搜索树。
# UCB-for-trees (UCT) selection score at a node score(a) = Q(s,a) + c * sqrt( ln N(s) / N(s,a) ) # exploit value explore rarely-tried actions
這正是 AlphaGo 背後的引擎:一個學習得到的策略網路提議走法、一個價值網路評分局面、MCTS 把它們縫合成深度的向前看,而自我對弈產生訓練資料。其後繼者 MuZero 走得更遠——它學習自己專屬的潛在動態模型,並完全在該學習模型內執行 MCTS,溶解了本指南中基於模型與搜尋兩大家族之間的界線。