動態規劃
完整回溯與抽樣回溯(full backup vs. sample backup)
更新一個狀態的價值時,你要對接下來可能發生的事做總和。完整回溯用模型,把每一個可能的下一狀態與獎勵都按其機率加權——周全但昂貴。抽樣回溯只用一次真正發生的轉移——便宜、不需模型,但有雜訊。這個對比,正是動態規劃與樣本式學習之間的分界線。
動態規劃做的是完整回溯:它需要轉移機率,而且要碰到每一個後繼狀態,所以每個狀態的成本隨分支因子增長。時間差分與 Q 學習做的是抽樣回溯:它們觀察一次轉移,把價值往那個單一目標推一下,完全不需要模型。完整回溯精確,但在模型未知或分支龐大時不可行;抽樣回溯用變異換取了直接從原始經驗學習的能力。
\underbrace{\sum_{s',r}p(s',r\mid s,a)\big[r+\gamma v(s')\big]}_{\text{full backup}}\quad\text{vs.}\quad \underbrace{r+\gamma v(s')}_{\text{sample backup}}
對整個模型求和,相對於一次觀察到的轉移。
另见