深度強化學習基礎
分布式貝爾曼方程(distributional Bellman equation)
一般的價值學習只問一個問題:從這裡開始,平均而言會有多少回報?但兩種情境可以有相同的平均值,感受卻天差地遠——穩定涓滴的得分,相對於在大獎與破產之間擲硬幣。分布式觀點保留整個散布,而不只是平均。智能體不再學期望回報,而是學回報的分布:所有可能結果的完整範圍,以及每種結果有多可能。
分布式貝爾曼方程就是那個分布所遵循的遞迴規則。一個狀態的回報等於立即獎勵,加上下一個狀態回報分布的一份折扣副本——所以你把下一個分布平移立即獎勵、再乘以 gamma 縮放,而不只是對數字做縮放與相加。訓練就是讓預測的分布去匹配這個自舉的目標分布。即使你最終仍按平均值行動,學習完整分布也提供更豐富、更穩定的訓練訊號,這正是 C51、QR-DQN 這類分布式智能體常勝過只學期望值的同類的原因。
Z(s,a) \stackrel{D}{=} R(s,a) + \gamma\, Z(s',a')
分布式貝爾曼方程,分布意義下的相等
另见