離線強化學習
離線強化學習(offline reinforcement learning)
想像你要學會管理一間醫院病房,但只能讀過去幾年累積的病歷紀錄,畢業前從未真正照顧過一位活生生的病人。離線強化學習(offline reinforcement learning)正是如此:你拿到的是一份固定的過往經驗資料集——狀態、動作、獎勵、下一個狀態——必須完全只靠它榨出最好的策略,不能再做任何互動。不能探索,不能試一個點子看看會怎樣。這份紀錄就是你僅有的一切。
形式上,你拿到一份由某個行為策略蒐集來的轉移資料集,並只用這份資料來最佳化一個策略、使其期望回報最大。只要實地實驗成本高、速度慢或有危險——醫療、機器人、推薦系統、自駕——這種設定就極具吸引力,因為它把強化學習變得更接近在紀錄上做監督式學習。
難處定義了整個領域:好策略總會想採取資料裡幾乎沒出現過的動作,而在那些地方價值估計只是毫無依據的臆測,你也無從驗證。離線強化學習裡的一切,本質上都是一套「在有資料的地方放心、在沒資料的地方謙卑」的策略。
J(\pi)=\mathbb{E}_{\tau\sim\pi}\!\left[\sum_t \gamma^t r_t\right]\quad\text{maximized using only}\ D=\{(s,a,r,s')\}
只用固定資料集 D 來最大化期望回報——全程不允許任何新的互動。
又称
另见