前沿與開放問題

離線元強化學習(offline meta-RL)

兩個難題在此交會。離線 RL 從一份固定資料集學習、不做任何新互動;元 RL 學的是如何快速適應新任務。離線元強化學習(offline meta-RL)把兩者結合:從跨許多任務的一批靜態日誌經驗中學習,使得在測試時,智能體能快速適應一個全新任務——理想上只靠那個任務的一小批資料——而且全程都不必上線互動。可以想成:純粹靠閱讀大量過往案卷,就學會「成為一個學得很快的人」。

它之所以誘人,是因為一次就移除了兩項最昂貴的需求:沒有冒險的線上探索,也沒有昂貴的逐任務資料蒐集。但它也把兩者的困難疊在一起。它繼承了離線 RL 的分佈偏移——也就是「相信資料集從未涵蓋過的動作」這個危險——以及元 RL 對「測試時任務分佈要真的吻合」的需求,再加上一個微妙的問題:離線資料是由某個行為策略蒐集的,而那套探索是智能體無法重做的。

離線元 RL 是最有實務動機的前沿主題之一,因為醫療、機器人車隊與推薦這類真實領域,本來就坐擁龐大的多任務日誌,又負擔不起自由實驗。它座落在離線 RL、元 RL 與遷移的十字路口,而「可靠地從固定資料中學會適應」仍是一個開放的挑戰。