深度強化學習基礎
類別式 DQN(categorical DQN, C51)
C51 是第一個讓分布式強化學習在實務上奏效的深度智能體。它表示回報分布的訣竅刻意地簡單:釘死一格固定的可能回報值——五十一個等距的點,名字便由此而來——讓網路為每一個點輸出一個機率。分布於是變成那些固定箱格上的一張小直方圖,智能體學的就是為每一個狀態–動作對塑造那張直方圖。
微妙之處在於更新。分布式貝爾曼目標會平移與縮放下一個分布,結果通常落在固定格點之間,所以 C51 先把它投影回格點,再以預測與目標兩張直方圖之間的交叉熵來衡量損失。這個投影是這套方法繁瑣的核心。C51 在 Atari 上明顯勝過普通 DQN,證明分布式強化學習不只是個新奇玩意;但它的弱點正是那格網格:你必須事先選定它的範圍與解析度,落在範圍外的回報會被截斷。
又称
另见