基於模型的強化學習

MuZero 規劃(MuZero planning)

MuZero 問了一個激進的問題:要規劃得好,你真的需要預測世界長什麼樣子嗎?它的答案是「不需要」。MuZero 學的模型完全不重建觀測——它只預測規劃實際會用到的量,也就是獎勵、價值與策略——再在這個抽象模型裡跑強大的樹搜尋來選擇走法,在從未被告知規則的情況下精通了圍棋、西洋棋、將棋與 Atari。

它有三個在潛在空間中協作的習得元件:一個表徵函數把真實觀測映成初始的隱藏狀態,一個動態函數把隱藏狀態與動作映成下一個隱藏狀態加上一個預測獎勵,一個預測函數把隱藏狀態讀成一個策略與一個價值。蒙地卡羅樹搜尋展開動態函數來建一棵搜尋樹,而整個模型是端到端訓練的,使它預測的獎勵、價值與策略,吻合真正發生的結果與搜尋所建議的選擇。

MuZero 之所以重要,是因為它在沒有給定模擬器的情況下統一了規劃與學習:AlphaZero 需要真實規則,它卻學出了自己的模型。代價是它的隱藏狀態是價值等價的,並不可解讀——這個模型對「後果」判斷正確,卻無法給你看一張它所想像的未來圖像。

MuZero 是價值等價模型的典範:訓練目標是讓規劃給出正確答案,而非讓它能重現觀測。

又稱
MuZero