馬可夫決策過程

軌跡與推演(trajectory and rollout)

軌跡是一次執行的故事:智能體從某處出發,採取一個動作,看到下一個狀態與獎勵,再行動,如此繼續,一條從頭延伸到尾、由狀態、動作與獎勵串成的鏈。推演則是產生這樣一個故事的動作:把一個策略放進環境(或環境的模型)裡跑,並記錄所發生的一切。

軌跡是強化學習的原始資料。幾乎每個演算法都靠收集推演、再從中榨取資訊來學習:蒙地卡羅方法沿著一條軌跡把獎勵加總來估計價值,策略梯度依整條軌跡賺得的回報多寡來重新加權它,而規劃器則在動真格之前先在模型裡想像推演。由於世界常是隨機的,單一軌跡充滿雜訊,因此我們通常會對許多條取平均。

\tau=(s_0,a_0,r_1,s_1,a_1,r_2,\dots)

一條軌跡是狀態、動作與獎勵的序列。

又稱
episode tracesample pathrollout