模仿學習與逆向強化學習
專家的次佳性(expert suboptimality)
專家的次佳性是一種誠實的承認:真實示範鮮少完美。遠端操控機器人的人手會抖、遊戲對局紀錄裡神來之筆與失誤夾雜,不同示範者彼此還會有分歧。天真的模仿會忠實複製這一切——連錯誤一起——於是學習者可能繼承、甚至放大你原本想避開的那些缺陷。
各種作法的差別在於你握有多少旁側資訊。若示範帶有排名或評分,你可以對它們加權或排序,學著偏好較好的行為,有時甚至外推超越最佳示範者。若你有獎勵訊號,示範引導的強化學習能讓智能體把示範當提示而非聖旨,進而超越它們。穩健的模仿方法則改為降低離群值的權重,或明確地建模示範者的雜訊。
觀念上的轉變是:別再把專家當成真理,而是把示範看成關於某個目標的、有資訊但會出錯的證據——而你仍被允許去超越那個目標。
又称
另见