前沿與開放問題
非監督式強化學習(unsupervised RL)
一般來說 RL 需要獎勵才能學——但如果還沒有給任何獎勵呢?非監督式強化學習(unsupervised RL)的想法,是讓智能體在任務尚未定義之前,先在環境裡練習,於是當獎勵終於到來時,它早已懂得如何移動、探索、有效率地抵達各種狀態。這個類比是個玩耍中的孩子:沒人會遞給幼兒一張計分板,但好幾個小時漫無目的的玩耍,已經建立起運動技能,以及一個「世界如何回應」的模型。
在沒有外在獎勵的情況下,智能體會自己發明訊號。常見的目標有:獎勵新奇或驚奇的內在動機、獎勵「能抵達許多不同未來狀態」的賦能(empowerment),以及學出一組多樣且可彼此區分行為的技能發現方法。它的產物不是一個成品策略,而是一組預訓練好的技能、一個良好的狀態表徵,或一個已被探索過的回放緩衝——一個地基,之後再用一段短短的、由獎勵驅動的微調去把它特化。
這種重新框架——先非監督預訓練、再快速任務適應——正是改造了視覺與語言的同一套配方,而且它直接攻擊樣本效率與探索這兩個問題。開放的問題是:哪一種內在目標能產生最可重用的行為,以及如何保證預訓練真的對下游任務有幫助,而不是漫遊到環境裡毫無用處的角落。
另見