基於模型的強化學習
機率動態模型(probabilistic dynamics models)
機率動態模型(probabilistic dynamics models)不只是猜下一個狀態——它還說自己有多確定。它不押在單一個預測結果上,而是輸出一個分布:也許下一個位置最可能在這裡,但有這麼大的散布,而那邊它幾乎沒有資料,就該承認自己在瞎猜。事實證明,這份謙遜正是「能安全用來規劃的模型」與「自信地把你帶歪的模型」之間的差別。
兩種不確定性都重要。偶然不確定性(aleatoric)是環境裡真正的隨機——雜訊感測器、隨機轉移——靠預測一個分布來捕捉,常是一個平均與變異數都由網路給出的高斯分布。認知不確定性(epistemic)是模型因資料有限而自身的無知,隨著你蒐集更多資料而縮小;捕捉它通常需要貝氏方法或集成。如此一來,規劃可以避開模型不確定的區域,或刻意去探索它們。
好處是穩健:一個知道「模型不知道什麼」的規劃器,不會去未探索的角落追逐一個幻影般的高獎勵。代價是把不確定性估好並不容易,而一個校準不良的模型——在不該自信的地方過度自信——可能比一個誠實的確定性模型還糟。
又稱
另見