函數近似

致命三要素(the deadly triad)

這是 Sutton 與 Barto 為三種要素取的名字:當它們湊在一起時,會讓價值學習爆掉。三者各自單獨都沒問題,合起來卻很危險。這三者是:函數近似(在狀態間共用權重)、自舉(像 TD 那樣用一個猜測去更新另一個猜測),以及離策略訓練(用某個策略產生的資料去學另一個策略)。

三者俱全時,對某狀態的更新可能改動你拿來計算它的那些狀態本身的自舉目標,而離策略資料帶來的分布不匹配,又使得保證收斂的那個收縮性不再成立。誤差會回饋並被放大,於是即使在極小的問題上權重也會發散到無窮(Baird 的反例就是經典示範)。

拿掉任一條腿,穩定性就回來了:用蒙地卡羅取代自舉、保持同策略,或用表格取代近似。現代深度強化學習三者全留(威力正來自於此),改而倚靠目標網路、經驗回放,以及梯度 TD 之類的修法去馴服這份不穩定。

每一條腿單獨都無害;不穩定純粹是三者交互作用的結果。

又称
deadly triad