探索

資訊增益探索(information-gain exploration)

對「該往哪探索」最有原則的回答是:往你預期學到最多的地方。資訊增益探索評價一個動作,不看它帶來的獎勵,而看它預期能把智能體對世界的不確定性減少多少——形式上,是其信念熵的期望下降量,或等價地,是下一個觀察與未知動態之間的互資訊(mutual information)。智能體尋求的是實驗,而不只是獎勵。

這把探索化為最佳實驗設計,給了好奇心一個乾淨、統一的說法——像變分資訊最大化(VIME)這類方法,會加上一份等於「一次轉移對智能體模型參數提供多少資訊」的內在獎勵。它的吸引力在於瞄準有用的驚訝,忽略帶不出資訊的雜訊。代價是估計期望資訊增益需要一個「對智能體自身不確定性」的模型,這在深度網路裡既近似又昂貴。

r^{i}_t = \mathrm{H}\!\left[P(\theta\mid \mathcal{D}_t)\right]-\mathbb{E}\!\left[\mathrm{H}\!\left[P(\theta\mid \mathcal{D}_t, s_{t+1})\right]\right]

內在獎勵是下一次轉移後,對模型不確定性的期望減少量。

又称
information-directed explorationcuriosity as information gain