離線強化學習

軌跡 Transformer(trajectory transformer, TT)

決策 Transformer 只預測下一個動作,軌跡 Transformer 則把一切——狀態、動作、獎勵——都當成一條長序列來建模,成為「軌跡如何展開」的完整模型。它把離線強化學習重新表述成序列建模加上規劃。

它把整條軌跡離散化並標記成 token,訓練一個 transformer 預測下一個 token,學出未來狀態、動作與獎勵的聯合分布。要做決策時,它在這個學到的模型上用集束搜尋(beam search)規劃,去尋找高獎勵的後續,而不是只讀出單一個被條件化的動作。

由於它在學到的軌跡模型「裡面」做規劃,它能完成純回報條件做不到的功勞分配與縫接,代價是昂貴的序列層級搜尋。它正位於離線強化學習與基於模型的強化學習之間的邊界。

又稱
TT