基於模型的強化學習

模型偏差與誤差累積(model bias and compounding error)

這是基於模型強化學習的頭號反派。習得的模型永遠不會完全正確,所以每一次預測都帶著一點誤差。當你把預測串成一段展開,模型的下一個輸入正是它自己稍有偏差的輸出,於是誤差自我餵養:第一步的小錯到第二步變成大錯,串得夠久之後,想像的軌跡就晃到了真實世界永遠不會去的地方。

兩種失靈交織在一起。模型偏差指模型系統性地往某個方向偏,誤差累積則指這份偏差在視野上被放大,往往隨展開長度指數成長。更糟的是,規劃器或策略最佳化器會主動去獵取高預測獎勵,這把它直接引向模型的盲點——去鑽模型在沒有資料處憑空編造的虛構獎勵。緩解之道包括:縮短展開、使用考慮不確定性的集成、讓想像展開從真實狀態分叉而出,以及頻繁重新規劃。

理解這種誤差,正是脆弱的基於模型智能體與穩健者之間的分野。整門功夫就在於:只在模型可信之處倚賴它,並在它的想像腐化成虛構之前及時收手——把展開保持得夠短、依信心程度替它們加權,並不斷讓智能體重新立足於真實經驗,使誤差被修正的速度,快過它累積的速度。

一套在模型裡分數亮眼、到現實卻一敗塗地的策略,正是經典症狀——它學會的是鑽模型的漏洞,而非解決任務。

又称
compounding model errormodel exploitation