強化學習理論

內在動機與探索(intrinsic motivation and exploration)

當外在報酬稀少,只追逐報酬的代理人可能徘徊許久卻一無所學。內在動機賦予代理人自己的好奇心:對遇到新奇或令人意外之事物給予內部獎勵,使它在任何任務報酬出現之前,就能有意義地探索。

其機制是在報酬上加一個內在項,而各流派對「什麼算有趣」看法不同。預測誤差式好奇心,如內在好奇心模組(ICM),獎勵那些「在學習而來的特徵空間中,前向模型預測不準」的狀態,並用逆向模型學出忽略不可控雜訊的特徵。新奇性與計數式方法透過偽計數,或如隨機網路蒸餾(RND)中「訓練去匹配固定隨機目標之網路」的誤差,來獎勵鮮少造訪的狀態。資訊增益與賦能(empowerment)則把好奇心形式化為降低不確定性或最大化控制力。此獎勵通常會隨狀態變熟悉而衰退。

一個惡名昭彰的陷阱是「電視雜訊問題」(noisy-TV):純隨機的來源看起來永遠令人意外,會困住天真的好奇心代理人;特徵空間法與固定隨機目標法正是為抵抗它而設計。

電視雜訊問題是試金石:任何獎勵「原始不可預測性」的好奇心,都會盯著無法化約的隨機性,而非可學習的結構。

又称
curiosity-driven explorationintrinsic reward內在動機