前沿與開放問題
元強化學習(meta-reinforcement learning)
多數 RL 智能體面對每個新任務都從一張白紙開始。元強化學習(meta-reinforcement learning)問的是更尖銳的問題:智能體能不能「學會如何學習」,於是當它遇到一個取自熟悉家族的新任務時,能在幾個回合內就適應,而不必花上數百萬步?這個畫面,就像一隻跑過很多迷宮的實驗鼠——牠不會從頭硬解一個新迷宮,而是知道迷宮大致怎麼運作,並有效率地試探。
嚴格地說,我們跨越一個任務分佈(不同的獎勵函數或動態)來訓練,使智能體取得的是一套「適應的程序」,而不只是單一策略。主要有兩大家族。基於梯度的方法(例如學一個好的初始化)會調整網路,讓少數幾步梯度更新就能把它特化。基於情境或循環的方法則把近期經驗餵進一塊記憶——RNN 或 transformer——由它隱式地推斷自己身處哪個任務、並相應地調整行為,有時被形容為「把一套強化學習演算法學進權重裡」。
元 RL 令人興奮,因為快速適應正是真實部署所需要的;但它也繼承了難題:只有當測試任務真的來自訓練分佈時它才管用、元訓練本身既吃資料又不穩定,而在適應過程中為探索給予獎勵(智能體有時必須為了蒐集資訊而行動,而非為了得分)也依舊很微妙。它與更廣義的元學習(meta-learning)高度重疊。
又稱
另見