強化學習理論
決策變換器(decision transformer)
決策變換器把強化學習重新框定為單純的序列預測。它把一段軌跡寫成一串符元(token)餵給變換器:每一步包含尚待取得的回報、狀態與動作,並以監督式學習訓練它去預測下一個動作。測試時,你以一個想要的高回報作為提示,它便自回歸地生成那些在資料中傾向產生該回報的動作。
關鍵想法是以「待取回報」(return-to-go),也就是你所要求的未來報酬總和,作為條件,這使模型成為離線資料上「以回報為條件的行為克隆」。其中沒有自助(bootstrapping)、沒有時間差分學習,也沒有顯式的價值函數或策略梯度;它改為倚靠變換器在長脈絡上做功勞分派的長處。軌跡變換器(Trajectory Transformer)是其基於模型的近親,額外用集束搜尋(beam search)做規劃。
它優雅且在離線資料集上表現強勁,但本質上是條件式模仿:它難以超越「把資料拼接後可回復的最佳行為」,而要求一個資料給不出的回報,會產生校準不良的動作。
以回報為條件的可信度,止於資料本身:提示一個超出資料集所達成的回報,所生成的動作只是外推,而非計畫。
又称
另见