前沿與開放問題
持續強化學習(continual reinforcement learning)
想像你依序教一個智能體任務 A、再任務 B、再任務 C,而且沒有機會回頭重做 A。持續強化學習(continual reinforcement learning)研究的正是這種「任務串流」設定,而它的頭號反派是災難性遺忘:神經網路在學任務 B 時,傾向覆寫掉編碼任務 A 的那些權重,於是智能體悄悄地失去了它一度擁有的技能。目標是在不抹除舊技能的前提下持續學新東西。
這在 RL 裡比在監督式學習裡更難,因為資料本質上就是非平穩的——智能體自己不斷改變的策略,會改變它所看到的東西——所以「正常學習」與「有害遺忘」之間的界線是模糊的。標準工具箱借自廣義的持續學習:回放過去經驗的回放緩衝、保護重要權重的正則項,以及讓新任務擁有自己容量的模組化或可擴張架構。每一種都在穩定性(記得住)與可塑性(學得動)之間取捨,這正是這個領域的核心張力。
它之所以重要,是因為任何要活在真實世界裡的智能體,都會「依序」而非「一次到齊」地面對任務,而且不可能永遠把每一筆經驗都存下來。持續 RL 與終身 RL(lifelong RL)關係緊密;兩者的界線是軟的,但持續 RL 偏重在一個已知序列上的遺忘問題,而終身 RL 則偏重技能的開放式累積與重用。
另見