深度強化學習基礎
分位數迴歸 DQN(quantile regression DQN, QR-DQN)
QR-DQN 把 C51 的表示法裡外翻轉。C51 固定回報值、學它們的機率;QR-DQN 固定機率、學回報值。它問的是:第十百分位的回報是多少?第三十、第九十呢?網路輸出一組分位數估計,它們合起來就勾勒出分布,不必有誰事先去猜它的範圍。支撐集會自動適應回報實際所在之處。
它用分位數迴歸來學這些分位數,採用一種傾斜的絕對值損失——彈珠台損失(pinball loss)——對低估與高估施以不對稱的懲罰,使每個輸出落在它的目標分位數上。把那個損失做 Huber 平滑後的版本,就是實用的演算法。讓方法擺脫固定網格,去掉了 C51 的截斷問題,整體上也改善了結果;而分位數的想法進一步催生了 IQN 這類更靈活的分布式智能體。它是分布式強化學習工具箱裡 C51 的天然搭檔。
又称
另见