離線強化學習

回報條件策略(return-conditioned policies)

一般的策略把狀態對應到動作。回報條件策略則把「狀態加上一個目標回報」對應到動作:「既然我打算拿到 200 分,那此刻我該怎麼做?」測試時你只要請求一個高回報,策略就會表現得彷彿自己是那種能拿到這個分數的智能體。

訓練是監督式的。對每一筆記錄的轉移,你算出其後實際累積到的剩餘回報,再學著依據狀態與這個實現的回報去預測當時所採取的動作。這把強化學習重新表述成條件式模仿——有時稱為「以監督式學習做強化學習」或「上下顛倒的強化學習」——而且不需要任何價值函數。

它的魅力在於簡單與穩定;弱點在於請求一個分布外的回報本身就是一種分布偏移,而且這類方法承襲了模仿學習無法縫接的毛病。當資料中本就含有接近你所要求表現的軌跡時,它們表現最好。

又称
RvSreinforcement learning via supervised learningupside-down RL