探索
預測誤差探索(prediction-error exploration)
這是一個寬廣的想法,撐起了大半好奇心驅動的強化學習:讓智能體被吸往任何它自己的預測失靈的地方。智能體訓練一個模型去預測某樣東西——下一個狀態、它的某個特徵、另一個網路的輸出——再把預測誤差的大小變成一份獎勵。誤差大代表這是個不熟悉、資訊豐富的情境,所以追逐誤差就是追逐學習。
它的吸引力在於不需要造訪計數,又能擴展到高維輸入;危險在於並非所有預測誤差都值得追尋。源自真正新奇的誤差是有用的,但源自固有隨機性的誤差——無論看多久都永遠無法預測的雜訊——是個陷阱,可能讓一個好奇的智能體呆呆凍結在純粹的雪花畫面前。各種好奇心方法之間的差別,主要就在於它們如何留下第一種誤差、丟棄第二種。
又称
另见