應用、環境與模擬到真實

課程學習(curriculum learning,RL)

就像你先學算術才學微積分,RL 智能體在任務由易到難排序時學得更快。若一上來就丟給它一個極度困難的任務,它可能根本拿不到任何獎勵、永遠起不了步;而課程則先遞給它一些早期的勝利,讓它有所憑藉地往上疊。

你安排一連串難度遞增的任務或環境設定——更短的距離、更慢的對手、更少的干擾物——並在智能體精通每一階段後讓它晉級。難度可以人工設計、自動生成(環境提出剛好略超出當前能力的任務),或由自我對弈驅動,使對手永遠是勢均力敵的一方。目標生成與「反向課程」(從接近目標處開始,再把起點逐步推遠)都是熱門的變體。

課程若挑得不好,反而會誤導:在簡單版本上學到的技能可能無法遷移,或智能體會對早期階段過度擬合。這個排序必須真正導向最終任務,而不只是導向「當下最容易」的那一步。

又称
easy-to-hard trainingtask curricula