JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

學會學習,並持續學習

與其為單一任務訓練單一策略,不如打造能快速適應、把知識帶著走而不遺忘、甚至在完全沒有獎勵下也能長出技能的智慧體。

從「一個策略」到「一套學習演算法」

元強化學習(meta-RL)翻轉了優化的對象。一般 RL 產出的是一個擅長單一任務的策略;元 RL 則跨一整個任務分佈來訓練,使輸出變成一個快速學習者——一個被丟進相關新任務後,幾回合內就能摸索出來的智慧體。這正是 元學習(meta-learning,「學會學習」)在 RL 中的面貌。主流有兩種配方:以優化為基礎的元 RL 學出一個能快速微調的初始化;以情境(循環記憶)為基礎的元 RL 則讓記憶當場吸收新任務,把適應本身當成網路執行的東西,而不是你要重新訓練的東西。

Q 学习只精通单个网格世界;元强化学习则在这类任务的整个分布上训练,从而得到一个快速学习者,而非一个固定策略。

一个交互式网格世界,智能体通过试错学习策略。

遷移——別從零開始

RL 中的遷移(transfer)會把在來源任務學到的東西拿來加速目標任務——一個特徵抽取器、一個價值函數、一組技能,或一整個之後再微調的預訓練策略。它的潛力巨大(直接同時進攻泛化與樣本效率兩道鴻溝),但失敗模式同樣顯著。負遷移發生在來源知識反而誤導目標時;對某個獎勵完美的表徵,對另一個獎勵可能恰好是錯的。唯有當來源與目標真的共享結構——動態、目標或因果機制——遷移才會可靠。

一個實務上的近親,是把模擬到硬體的現實落差(reality gap)補起來:領域隨機化(domain randomization)在大量隨機化的模擬器上訓練,使真實世界看起來只是另一個變體。這就是遷移加上泛化的實際落地。

持續學習與終身學習

遷移通常只跳一步,來源到目標。持續強化學習(continual RL)與終身強化學習(lifelong RL)要求的是一條串流:一個非平穩、一個接一個學下去、沒有乾淨邊界也回不了頭的任務序列。頭號敵人是災難性遺忘(catastrophic forgetting)——為新任務走的梯度步,會覆寫掉原本解決舊任務的權重。深層的張力是穩定性與可塑性的兩難:太穩定就學不到新東西,太可塑則把學過的全抹掉。

  1. 回放(rehearsal):保留或生成舊任務的樣本,混進新訓練裡,讓梯度不要漂得太遠。
  2. 正則化:對那些曾對過去任務重要的權重,懲罰其變動(保護得來不易的部分)。
  3. 架構:給新任務新的容量(加入模組或遮罩),讓它們不必爭搶同一批參數。

無監督強化學習——考試前先練習

如果智慧體能在完全沒有獎勵的情況下變強呢?無監督強化學習(unsupervised RL)做的正是這件事:在一段長長、無獎勵的階段裡,智慧體追求內在目標——好奇、新奇、賦能或多樣性——以建立一套行為庫與一個有用的世界表徵。等真正的獎勵終於出現時,學習就會快上許多。旗艦想法是技能發現(skill discovery):在心中沒有任何任務的前提下,學出一組彼此可區分的技能,使得解決下游任務大致變成在你已擁有的技能中做選擇

无监督强化学习是强化学习版的自监督预训练——在任何任务奖励到来之前,先用一个无奖励阶段积累通用能力。

图示:对比三种学习范式——监督学习、无监督学习与强化学习。

離線元強化學習——從歷史紀錄學會快速適應

把兩個前沿想法疊起來,就得到離線元強化學習(offline meta-RL):只用來自許多任務的歷史資料集來元學習一個快速適應器,元訓練期間完全不需要新的互動。對於新嘗試成本高昂的高風險領域,它極具吸引力,但也同時繼承了兩位「父母」最難的部分——離線 RL分佈偏移(資料只涵蓋某個舊行為策略做過的事),以及元 RL 要求對真正的新任務泛化。要一次把兩者都做對,是一個活躍的研究前線。

\theta^\star=\arg\max_{\theta}\;\mathbb{E}_{\mathcal{T}\sim p(\mathcal{T})}\Big[\,\mathbb{E}_{\tau\sim\pi_{\phi_{\mathcal{T}}}}\big[R(\tau)\big]\,\Big],\qquad \phi_{\mathcal{T}}=U\!\big(\theta,\,\mathcal{D}^{\mathrm{tr}}_{\mathcal{T}}\big)

元强化学习目标;离线元强化学习仅用已记录的数据集来优化同一目标,无需任何新的交互。