前沿與開放問題
終身強化學習(lifelong RL)
終身強化學習(lifelong RL)採取長遠的視角:智能體不是去精通單一任務,而是活過一條漫長、開放式的任務串流,並以它在整個一生中「累積、組織、重用技能」的好壞來評斷。這個畫面比較不像一場考試,更像一段職涯——早期的經驗應該讓後來的經驗更省力,就像一位資深工程師靠重組數十年所學去解決一個新問題。
技術核心是建立並維護一個不斷成長的技能庫:一座技能或選項的資料庫、可重用的表徵,或許還有一個隨時間愈來愈豐富的世界模型,而這一切都要在不遺忘、又能向真正全新情境前向遷移的前提下進行。因此它座落在遷移、持續學習與階層式 RL 的交會處,通常用「智能體活得愈久、在新任務上的學習速度是否愈快」來評估。
終身 RL 與其說是已解決的設定,不如說是一個志向。我們還沒有那種「看的任務愈多、就愈擅長學習」、又不致遺忘或在規模與算力上失控膨脹的智能體。它與持續 RL 以及開放式學習關係密切,並且是「一個真正通用的學習型智能體必須做到什麼」最清楚的陳述之一。
另見