基於模型的強化學習
價值等價模型(value-equivalent models)
一個模型可以「好」在兩種意義上。一種是忠實地重現世界,像素對像素。另一種——價值等價的觀點——只要在關鍵處好就行:若用某個模型做規劃,得到的價值與決策,和用真實環境做規劃一致,那它就是價值等價的,哪怕其餘一切都錯。對控制而言,你真正需要的是後者。
這重新框定了模型學習。你不再訓練模型去把對觀測的預測誤差降到最小,而是訓練它使得在其之上做的規劃運算——價值回溯、它所隱含的策略——結果正確。一個模型可以扔掉大量無關的視覺細節,卻仍對選擇動作完美無瑕,這正是 MuZero 這類系統能運作的原因:它們習得的動態是為「後果」而最佳化,而非為「外觀」。
它的吸引力在於聚焦:價值等價模型把有限的容量花在對任務重要的事情上。代價是通用性——一個為單一獎勵與單一規劃器調好的模型,換一個目標可能就毫無用處,因為它本來就不打算捕捉世界,只想捕捉決策。
又称
另见