離線強化學習

決策 Transformer(decision transformer, DT)

決策 Transformer 把價值函數與貝爾曼方程式統統丟掉,改問一個全然不同的問題:如果把強化學習當成序列預測會怎樣?把一條軌跡寫成「期望回報、狀態、動作、回報、狀態、動作」的資料流餵給一個 transformer,訓練它預測下一個動作。要行動時,你就告訴它你想要的回報,讓它自動補完。

每個時間步被標記成(剩餘回報 return-to-go、狀態、動作)這個三元組。模型用純監督式的「下一個 token」損失訓練,依據歷史與剩下的期望回報來預測動作。完全沒有時序差分學習——功勞分配是由序列上的注意力隱式處理的。

它優雅而穩定,承襲了大型序列模型的長處。但若把條件設定在一個你從未達成過的回報上,可能會失靈;而且純粹的回報條件,難以像價值類方法那樣把次佳軌跡縫接起來。

又称
DT