探索

內在好奇模組(intrinsic curiosity module,ICM)

小孩探索不是為了外在獎勵,而是因為驚訝本身就讓人感到愉悅。內在好奇模組賦予智能體同樣的驅力:它學一個能預測每個動作後果的模型,每當那個預測結果出錯,就付給智能體一份獎勵。智能體還無法預測的狀態令它興奮;已經掌握的狀態則無聊,於是它持續往「它所理解的邊緣」推進。

巧妙之處在於預測發生的地方。為了避免被「無法預測卻無關緊要的雜訊」迷住——閃爍的電視、搖晃的樹葉——ICM 先學一個只保留「智能體動作能影響之物」的特徵空間,做法是用一個從前後特徵預測動作的逆模型。好奇心於是定義成一個前向模型在那個空間裡的誤差。這過濾掉了干擾,不過真正「隨機但可控」的動態仍可能絆住它,也就是所謂的雜訊電視(noisy-TV)問題。

r^{i}_t=\tfrac{\eta}{2}\,\lVert \hat{\phi}(s_{t+1})-\phi(s_{t+1})\rVert^{2}

好奇心獎勵是前向模型在特徵空間中預測誤差的平方。

又称
ICMcuriosity-driven exploration