前沿與開放問題

強化學習中的泛化(generalization in RL)

想像一個智能體被訓練到能過某款電玩的二十個關卡,然後被丟進它從沒見過的第二十一關——它還能玩得好,還是當場崩潰?這個落差就是強化學習中的泛化(generalization):在訓練時從未出現過的環境、佈局與任務上仍能表現良好的能力。在監督式學習裡,我們習慣用一份保留的測試集來衡量這件事;但在 RL 中,它長期被當成事後才想的問題,因為多年來智能體都是在「完全同一個環境」裡訓練又測試。

具體來說,我們從某個分佈中抽出訓練任務與測試任務——不同的迷宮佈局、物理參數、視覺紋理或目標位置——再看切換時表現掉了多少。失敗的情形很驚人:智能體會對單一關卡的像素樣式過擬合、背下一條固定路線而非真正學會導航,並在極小的視覺變動下整個垮掉。Procgen、Meta-World 這類基準,正是為了用「測試時程序化生成全新關卡」來戳破這件事而設計的。

泛化正位於「RL 為何至今難以落地」的核心:一個只在它受訓的那個房間裡管用的策略,不是智慧,而是一張昂貴的查表。進展來自領域隨機化、資料增強、正則化與更豐富的任務分佈,但目前還沒有任何方法能給出我們在人類身上視為理所當然的那種廣泛而可靠的遷移。它仍是這個領域定義性的開放問題之一。