強化學習是什麼

累積獎勵的直覺(cumulative reward intuition)

強化學習要你做的最重要的一個思維轉變是:在意一段時間裡的總獎勵,而不是下一個獎勵。一步現在得零分、卻為日後大勝鋪路的棋,勝過一步華麗地搶下一分卻輸掉整局的棋。智能體真正的目標,是從此刻起所有未來獎勵的總和,稱為回報(return)。

通常我們用打過折扣的總和:把每個未來獎勵乘上一個介於 0 與 1 之間、並依距離多遠而連乘的因子。這會溫和地偏好較早的獎勵,反映出對遙遠未來的不確定,也讓無止盡的任務裡總和保持有限。調這個折扣因子等於設定智能體的視野——接近 0 會讓牠短視又貪婪,接近 1 則讓牠有耐心又看得遠。

G_t = R_{t+1} + \gamma R_{t+2} + \gamma^2 R_{t+3} + \cdots

回報是從此刻起所有獎勵(打過折扣)的總和,不只是眼前那一個。