離線強化學習
外推誤差(extrapolation error)
去問一個價值網路「這個我從沒見過的動作有多好?」,它會充滿自信地回答你——而且往往是胡說八道。外推誤差就是這件事:函數近似器會樂呵呵地替資料中不存在的狀態—動作配對給出價值,而那些值可能錯得離譜、毫無邊際,因為資料從未對它們施加任何約束。
它會透過自助(bootstrapping)變得災難性。Q 學習的目標會對動作取最大值;若某個沒見過的動作帶著虛高的值,最大值就會選中它,這個被灌水的數字往回傳播進其他狀態,整個價值函數隨之膨脹。策略於是信心滿滿地追逐海市蜃樓。
這正是為什麼像 DQN 或 DDPG 這類天真的離策略演算法,純離線執行時常常崩潰。把外推誤差認定為元兇,開啟了現代離線強化學習:每一種修法,不是避免查詢沒見過的動作,就是主動把它們的值壓下去。
y=r+\gamma\max_{a'}Q(s',a')
若使其最大的動作 a' 從未出現在資料中,它的價值不受約束,整個目標就被汙染。
又称
另见