前沿與開放問題

開放式學習(open-ended learning)

多數學習都有終點線——一個固定任務、一個目標分數、一個「你做完了」的時刻。開放式學習(open-ended learning)拒絕終點線:它研究的系統會不斷地發明新挑戰並加以精通,自行生成愈來愈難的課程,使學習永不停滯。靈感來自演化與人類文化,它們在沒有任何外界遞進來的目標下,已經產生了數十億年無界限的新奇。

慣用的機制是智能體與其所面對問題之間的協同演化迴圈:一個環境生成器提出新任務或新關卡,智能體學著去解,而生成器則被推往那些既不太簡單、也非不可能——恰在當前能力前沿——的挑戰。POET、以及程序化擴張的遊戲世界都體現了這一點,並常搭配族群式訓練,讓多樣的智能體與生態棲位避免整個系統塌縮到單一招式。

開放式學習是 RL 裡最有野心的賭注之一:若能在規模上奏效,一個智能體就能在幾乎不需人工策劃的情況下,無限期地愈來愈有能力。但它也是最未定的主題之一——「衡量真正的開放式進展」本身就尚未解決、訓練可能停滯或漂移成無趣的新奇,而我們也缺乏「什麼讓一個生成器可靠地多產」的理論。它與終身學習以及課程設計關係密切。