前沿與開放問題
樣本效率前沿(sample-efficiency frontier)
小孩搖搖晃晃一個下午就學會騎腳踏車;而一個著名的 RL 智能體,卻要玩相當於數萬年的 Atari,才能達到人類分數。樣本效率衡量的就是這個落差——智能體要達到某個技能水準需要多少互動——而樣本效率前沿(sample-efficiency frontier)就是「用遠少的經驗學會有能力的行為」這個持續的推進。它大概是 RL 用於現實世界最大的單一障礙,因為在現實裡,每一個樣本都耗費真實的時間、能量或磨損。
它之所以難,是結構性的:RL 從一個常常稀疏又延遲的純量獎勵學習,它必須先靠探索才找得到那個獎勵,而且它還用自己充滿雜訊的猜測去自助估計價值。每一點都讓資料只能緩慢地發揮更大效用。我們手上的主要槓桿有:基於模型的 RL(學一個世界模型,在裡面做規劃)、透過經驗回放重複利用過去資料的離策略學習、把觀測壓縮的表徵學習,以及在任何即時互動之前先用既有日誌資料做離線預訓練。
它之所以重要,是因為對真實機器人、醫療與教育而言,受限的通常是資料而非算力。這條前沿推進得很快——現代方法只要幾小時的遊戲時間、而非好幾週,就能達到 Atari 的人類水準——但我們離動物那種少樣本適應力,仍差了好幾個數量級,而縮小這個差距是一項開放的研究計畫,而非已解決的工程任務。
另见