回報、價值與策略
期望回報目標(expected return objective)
任何單獨一次運行得到的折扣回報,都是個隨機數——環境可能擲骰子,智能體自己也可能隨機行動。所以我們無法只針對某次幸運的回合做最佳化;強化學習要最大化的是期望回報,也就是同一套策略反覆玩無數次後,平均會拿到的回報。這個單一數字是整個領域的北極星:每個演算法不管包裝得多花俏,最終都是想把這個平均值推得更高。
形式上,這個目標是回報在「策略與環境共同產生的軌跡分布」下的期望值。因為它是對回合所有可能展開方式取平均,所以改善它意味著整體上做得更好,而不只是某次走運。這個視角很重要:一個偶爾爆分、但通常失敗的智能體,期望回報很低,而強化學習會正確地偏好一個更穩、平均贏更多的策略。
J(\pi)=\mathbb{E}_{\tau\sim\pi}\!\left[\sum_{t=0}^{\infty}\gamma^t r_{t+1}\right]
目標 J 是策略所產生的軌跡上,折扣回報的期望值。
又称
另见