JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

評估、微調,以及實務者的操作手冊

你離線訓出了一個策略——但你怎麼知道它好不好?又該如何安全地讓它接觸真實世界?

評估的陷阱

在線上,你靠執行策略來衡量它。在離線,你不能——執行它正是你想避免的事,而為了比較每個檢查點都去跑一遍,更是本末倒置。因此離線強化學習中最困難、也最被低估的部分,往往不是訓練策略,而是在部署前信任它。

離策略評估 (OPE)

離策略評估 (OPE) 是一門科學:只用已記錄的資料,去估計一個新策略「」有多好。主要工具有重要性抽樣估計式(用你的策略選那些動作的機率,對已記錄的回報重新加權)、擬合價值估計式,以及在兩者間避險的雙重穩健(doubly-robust)組合。它們全都在「你的策略與行為策略偏離最大」之處變得不可靠——同樣的分佈偏移,如今又來糾纏評估。

\hat V(\pi)=\frac{1}{n}\sum_{i=1}^{n}\left(\prod_{t=0}^{T}\frac{\pi(a_t^i\mid s_t^i)}{\mu(a_t^i\mid s_t^i)}\right)\sum_{t=0}^{T}\gamma^{t}\,r_t^i

离策略评估用新策略与行为策略动作概率之比,对日志中的回报进行重加权——即重要性采样估计量。

  1. 切出一部分資料純粹用於 OPE——絕不拿來訓練。
  2. 回報一組估計式;若它們彼此差異極大,就對它們全部存疑。
  3. 行為複製基準做合理性檢查——在離線評估上贏過它,是最低門檻。

離線到線上的微調

通常最聰明的做法,是把離線資料當成熱啟動,再用一點點、小心控制預算的真實互動讓代理人進步。這就是離線到線上微調(offline-to-online fine-tuning)。陷阱在於一種討厭的轉換衝擊:一個高度悲觀的離線策略,在突然面對新鮮資料時可能崩潰,因為它過度保守的價值估計,是為「沒有新樣本的世界」調校的。像 IQL 這類方法,在轉換時比起像原版 CQL 那樣激進悲觀的方法更平順。

在线微调让智能体重新进入与环境交互的循环,以谨慎的真实交互预算改进热启动得到的策略。

强化学习循环示意图:智能体执行动作,环境返回新状态和奖励。

經實戰驗證的檢查清單

  1. 了解你的資料。它是如何收集的?動作涵蓋面有多廣?行為策略本身有多好?這決定了後續的一切。
  2. 永遠先跑行為複製若你的花俏方法贏不過單純的模仿,那是花俏方法壞了,而不是它厲害。
  3. 讓演算法配合資料形狀:窄/專家 → 模仿或 AWR;廣/混雜 → IQL 或 CQL;軌跡本就很強 → 序列模型。
  4. 把悲觀程度當成主旋鈕來調。太少 → 分佈偏移與發散;太多 → 一個膽小、只會複製資料的策略。
  5. 絕不能只憑訓練損失就部署。請用 OPE、保留集的估計,以及你負擔得起、最小且安全的一小段真實互動。

它正往哪裡去

離線強化學習正悄悄成為「把強化學習帶出模擬器、帶進雜亂現實」的預設方式——它也是大型模型如何從已記錄的人類回饋進行調校的骨幹,與離策略學習是近親。掌握本主題的三個核心——分佈偏移、悲觀主義、誠實評估——你就握住了這個領域大部分的鑰匙。所有更新的東西,都只是把同一份來之不易的資料花得更精準的方法。

用日志中的人类反馈微调大模型是离线强化学习的近亲:偏好训练出奖励模型,再用它塑造策略。

RLHF 示意图:人类偏好输入奖励模型,再由其微调策略。