回報、價值與策略
折扣回報(discounted return)
想像你是一個智能體,沿著時間不斷收集獎勵。折扣回報就是你從現在到結束預期能累積的全部獎勵,但有個轉折:越晚到手的獎勵算得越少。今天的一份獎勵,比十步之後同樣的一份更有價值,就像口袋裡的錢勝過明年才承諾給你的錢。這正是智能體做選擇時真正想放大的東西——不是眼前的即時獎勵,而是整條偏向近期的未來獎勵流。
具體來說,你把各步的獎勵加總,但每個未來獎勵都要乘上折扣因子的「距離次方」,而那個因子落在 0 與 1 之間。當它接近 0,智能體很短視,幾乎只在乎下一步的獎勵;接近 1 時,它幾乎把遙遠的未來看得一樣重。折扣也讓永不結束的任務裡那個總和保持有限,並悄悄編碼了「越早拿到好結果越好」的偏好。
G_t = \sum_{k=0}^{\infty}\gamma^k r_{t+k+1} = r_{t+1}+\gamma r_{t+2}+\gamma^2 r_{t+3}+\cdots
從第 t 步起的回報,是其後所有獎勵的幾何折扣總和。
又称
另见