評估的陷阱
在線上,你靠執行策略來衡量它。在離線,你不能——執行它正是你想避免的事,而為了比較每個檢查點都去跑一遍,更是本末倒置。因此離線強化學習中最困難、也最被低估的部分,往往不是訓練策略,而是在部署前信任它。
離策略評估 (OPE)
離策略評估 (OPE) 是一門科學:只用已記錄的資料,去估計一個新策略「會」有多好。主要工具有重要性抽樣估計式(用你的策略選那些動作的機率,對已記錄的回報重新加權)、擬合價值估計式,以及在兩者間避險的雙重穩健(doubly-robust)組合。它們全都在「你的策略與行為策略偏離最大」之處變得不可靠——同樣的分佈偏移,如今又來糾纏評估。
离策略评估用新策略与行为策略动作概率之比,对日志中的回报进行重加权——即重要性采样估计量。
- 切出一部分資料純粹用於 OPE——絕不拿來訓練。
- 回報一組估計式;若它們彼此差異極大,就對它們全部存疑。
- 用行為複製基準做合理性檢查——在離線評估上贏過它,是最低門檻。
離線到線上的微調
通常最聰明的做法,是把離線資料當成熱啟動,再用一點點、小心控制預算的真實互動讓代理人進步。這就是離線到線上微調(offline-to-online fine-tuning)。陷阱在於一種討厭的轉換衝擊:一個高度悲觀的離線策略,在突然面對新鮮資料時可能崩潰,因為它過度保守的價值估計,是為「沒有新樣本的世界」調校的。像 IQL 這類方法,在轉換時比起像原版 CQL 那樣激進悲觀的方法更平順。
强化学习循环示意图:智能体执行动作,环境返回新状态和奖励。
經實戰驗證的檢查清單
- 了解你的資料。它是如何收集的?動作涵蓋面有多廣?行為策略本身有多好?這決定了後續的一切。
- 永遠先跑行為複製。若你的花俏方法贏不過單純的模仿,那是花俏方法壞了,而不是它厲害。
- 讓演算法配合資料形狀:窄/專家 → 模仿或 AWR;廣/混雜 → IQL 或 CQL;軌跡本就很強 → 序列模型。
- 把悲觀程度當成主旋鈕來調。太少 → 分佈偏移與發散;太多 → 一個膽小、只會複製資料的策略。
- 絕不能只憑訓練損失就部署。請用 OPE、保留集的估計,以及你負擔得起、最小且安全的一小段真實互動。
它正往哪裡去
離線強化學習正悄悄成為「把強化學習帶出模擬器、帶進雜亂現實」的預設方式——它也是大型模型如何從已記錄的人類回饋進行調校的骨幹,與離策略學習是近親。掌握本主題的三個核心——分佈偏移、悲觀主義、誠實評估——你就握住了這個領域大部分的鑰匙。所有更新的東西,都只是把同一份來之不易的資料花得更精準的方法。
RLHF 示意图:人类偏好输入奖励模型,再由其微调策略。