離線強化學習

離線強化學習中的悲觀原則(pessimism in offline RL)

線上強化學習靠的是樂觀:不確定時,就去試、去弄清楚。離線強化學習則必須反其道而行。既然無從驗證一個直覺,你就該對任何資料無法擔保的事情往最壞處想——在證據稀薄之處,正要保持悲觀。

形式上,你不是去最大化價值估計本身,而是去最大化價值的一個信賴下界,減去一個在資料稀疏處變大的懲罰。這正是貫穿 CQL 的保守價值懲罰、BCQ 的支撐集約束、IQL 的樣本內學習的統一原則:全都是對「覆蓋不足的動作」保持悲觀的不同做法。

理論顯示悲觀不只是個經驗法則——它帶來的保證,其尺度取決於資料對「比較對象策略」涵蓋得多好,而非整個狀態—動作空間。其中的功夫在於拿捏分寸:足夠謹慎以求安全,又不至於保守到永遠無法改良。

\hat\pi=\arg\max_{\pi}\ \mathbb{E}_{a\sim\pi}\!\left[\hat Q(s,a)-\beta\,b(s,a)\right]

依信賴下界行動:減去一個在資料稀少處變大的懲罰 b。

又稱
pessimism principlepessimism under uncertainty