從「一個策略」到「一套學習演算法」
元強化學習(meta-RL)翻轉了優化的對象。一般 RL 產出的是一個擅長單一任務的策略;元 RL 則跨一整個任務分佈來訓練,使輸出變成一個快速學習者——一個被丟進相關新任務後,幾回合內就能摸索出來的智慧體。這正是 元學習(meta-learning,「學會學習」)在 RL 中的面貌。主流有兩種配方:以優化為基礎的元 RL 學出一個能快速微調的初始化;以情境(循環記憶)為基礎的元 RL 則讓記憶當場吸收新任務,把適應本身當成網路執行的東西,而不是你要重新訓練的東西。
一个交互式网格世界,智能体通过试错学习策略。
遷移——別從零開始
RL 中的遷移(transfer)會把在來源任務學到的東西拿來加速目標任務——一個特徵抽取器、一個價值函數、一組技能,或一整個之後再微調的預訓練策略。它的潛力巨大(直接同時進攻泛化與樣本效率兩道鴻溝),但失敗模式同樣顯著。負遷移發生在來源知識反而誤導目標時;對某個獎勵完美的表徵,對另一個獎勵可能恰好是錯的。唯有當來源與目標真的共享結構——動態、目標或因果機制——遷移才會可靠。
一個實務上的近親,是把模擬到硬體的現實落差(reality gap)補起來:領域隨機化(domain randomization)在大量隨機化的模擬器上訓練,使真實世界看起來只是另一個變體。這就是遷移加上泛化的實際落地。
持續學習與終身學習
遷移通常只跳一步,來源到目標。持續強化學習(continual RL)與終身強化學習(lifelong RL)要求的是一條串流:一個非平穩、一個接一個學下去、沒有乾淨邊界也回不了頭的任務序列。頭號敵人是災難性遺忘(catastrophic forgetting)——為新任務走的梯度步,會覆寫掉原本解決舊任務的權重。深層的張力是穩定性與可塑性的兩難:太穩定就學不到新東西,太可塑則把學過的全抹掉。
- 回放(rehearsal):保留或生成舊任務的樣本,混進新訓練裡,讓梯度不要漂得太遠。
- 正則化:對那些曾對過去任務重要的權重,懲罰其變動(保護得來不易的部分)。
- 架構:給新任務新的容量(加入模組或遮罩),讓它們不必爭搶同一批參數。
無監督強化學習——考試前先練習
如果智慧體能在完全沒有獎勵的情況下變強呢?無監督強化學習(unsupervised RL)做的正是這件事:在一段長長、無獎勵的階段裡,智慧體追求內在目標——好奇、新奇、賦能或多樣性——以建立一套行為庫與一個有用的世界表徵。等真正的獎勵終於出現時,學習就會快上許多。旗艦想法是技能發現(skill discovery):在心中沒有任何任務的前提下,學出一組彼此可區分的技能,使得解決下游任務大致變成在你已擁有的技能中做選擇。
图示:对比三种学习范式——监督学习、无监督学习与强化学习。
離線元強化學習——從歷史紀錄學會快速適應
把兩個前沿想法疊起來,就得到離線元強化學習(offline meta-RL):只用來自許多任務的歷史資料集來元學習一個快速適應器,元訓練期間完全不需要新的互動。對於新嘗試成本高昂的高風險領域,它極具吸引力,但也同時繼承了兩位「父母」最難的部分——離線 RL 的分佈偏移(資料只涵蓋某個舊行為策略做過的事),以及元 RL 要求對真正的新任務泛化。要一次把兩者都做對,是一個活躍的研究前線。
元强化学习目标;离线元强化学习仅用已记录的数据集来优化同一目标,无需任何新的交互。