模仿學習與逆向強化學習
單樣本模仿學習(one-shot imitation learning)
單樣本模仿學習追求的是人們視為理所當然的那種彈性:看一次全新任務的示範,馬上就能自己做。給系統看一個把「這些特定積木」依「這個特定順序」堆疊的範例,它就應當當場完成那個任務——不必重新訓練,也不需要第二次示範。
訣竅是事先訓練的不是針對單一任務的策略,而是一個把示範當成輸入一部分來讀取的策略。在一大群相關任務的分布上,網路學會去關注示範、萃取意圖,並據此來條件化自己的動作。測試時,一個未見任務的全新示範就只是變成新的脈絡,很像語言模型遵循一條它從未被明確訓練過的指令。
它把一般模仿那種沉重的「每任務資料」換成沉重的「事前後設訓練」,外加一個強假設:新任務與訓練分布相似;真正新穎的任務仍會讓它失靈。
又稱
另見