前沿與開放問題
強化學習中的遷移(transfer in RL)
RL 中的遷移(transfer)是個日常直覺:你在某個任務上學到的東西,應該能讓你在下一個任務上佔得先機。會打網球的人學壁球,比全然的新手快;一個學會在平地上行走的智能體,不該為了在斜坡上走路而重學一切。嚴格地說,遷移是把在來源任務上獲得的知識——一個策略、一個價值函數、學到的特徵,或一個世界模型——拿來重複利用,以加速一個相關目標任務的學習。
它有好幾種樣貌。你可以遷移表徵(看遊戲的那些卷積特徵)、用一個策略熱啟動再微調、把幾位老師蒸餾成一個學生,或遷移一個大致與任務無關的動態模型。好處可衡量為起跳優勢(更好的初始表現)、更快的學習,或更高的最終分數。而恆常的危險是負遷移:當來源與目標以「不對的方式」相異時,先驗知識反而主動扯後腿,智能體還不如從頭開始。
遷移是這條前沿上幾乎所有其他主題的基石——元 RL、持續學習與「模擬到現實」都是加了額外結構的遷移。開放的問題在於:如何在不靠人工挑選「該帶過去什麼」的情況下做到可靠的遷移;我們至今仍缺一套有原則的方法,能事先判斷哪些知識會幫上新任務、哪些會把它帶偏。
另见