強化學習
回報(return)
/ ree-TURN /
回報是那筆大總帳——智能體從某一刻起往後所收集的「所有」獎勵之和,而不只是下一份。單個獎勵是某一步的工錢;回報則是這一回合餘下全程的整張薪水單。這一區分,正是強化學習的靈魂:智能體要最大化的不是下一份獎勵,而是回報,也就是長遠的總和。
回報通常是打了折扣的,意思是越靠後的獎勵,在被加進來之前先被折扣因子縮小,於是「當下的一份獎勵」比「同等數額卻在遙遠未來的獎勵」算得更重。這就是為什麼一位棋手會樂意棄掉一個兵(眼前一點小損失)去贏下整局(未來一大筆收益):那個傷害「下一份獎勵」的著法,恰恰可能正是最大化「回報」的著法。
要把回報與價值分清楚,因為它倆很容易糊在一起。回報是「實際發生過的」——你在某一次特定對局裡真正拿到的總數,只有事後才知曉。價值則是「預測」——你在許多次對局裡所能期望的平均回報,是事先估出來的。價值函數之所以存在,恰恰是為了在你尚未親歷之前就預報回報;回報,正是它們想要猜中的那個標準答案。
某個回合產生的獎勵是:0、0、−1(丟一個兵)、0、+10(將殺)。從開局算起、不打折扣的回報是 0+0−1+0+10=9。棄兵壓低了前面的一份獎勵,卻抬高了總回報——而後者,才是智能體真正在乎的東西。
回報=未來所有獎勵的總和。一個壓低「下一份獎勵」的著法,可能抬高「回報」。
獎勵是某一步;回報是長遠的總和;價值是回報的期望。把這三者搞混,是強化學習裡頭號常見的糊塗。智能體從不去最大化即時獎勵——它永遠最大化回報,這恰恰是「為長遠收益而做短期犧牲」之所以可能的原因。
又稱
另見