深度強化學習基礎
獎勵截斷(reward clipping)
不同的 Atari 遊戲給出的分數天差地遠——有的一次只給一分,有的一擊就給上千分。單一網路配單一學習率,無法自在地學習橫跨如此不同尺度的價值目標;大獎勵的遊戲會主導梯度、破壞訓練的穩定。獎勵截斷是最初 DQN 採用的直率解法:把每個獎勵壓進一個固定範圍,通常是負一、零或正一,做法就是只取它的正負號。
好處是這樣一來,同一組超參數就能在所有遊戲上通用,而這正是一個通用智能體所需要的。代價是智能體對大小變得視而不見:一個極小的獎勵和一個巨大的頭獎看起來一模一樣,於是當兩者都拿得到時,它再也無法偏好較大的獎賞。這是個實實在在的限制,後來的分布式方法與價值重縮放方法,例如 R2D2 採用的可逆變換,部分就是為了讓獎勵維持在共同尺度上、同時不丟棄它們有多大而發明的。
另见