離線強化學習
離線轉線上微調(offline-to-online fine-tuning)
離線強化學習能在無風險下給你一個尚可的策略;線上強化學習能把它磨亮,但從頭做起既昂貴又危險。自然的結合是:先在固定資料集上離線預訓練,再讓智能體稍作互動來精修——先取得安全的領先起跑,再把最後一段差距補上。
你用離線訓練得到的價值函數與策略當作初始化,接著繼續做線上更新,此時開始蒐集新資料。摩擦在於:讓離線學習得以穩定的那份保守,可能會勒住線上的進步;而資料分布的驟變,可能造成短暫的下滑、甚至崩潰。
如何優雅地設計這個過渡——逐步放鬆悲觀、平衡離線與線上資料、讓價值估計保持校準——是個活躍的研究方向。AWAC、IQL、Cal-QL 等方法正是為了能微調而不崩散而設計的。
又称
另见