離線強化學習

保守 Q 學習(conservative Q-learning, CQL)

保守 Q 學習正面迎戰高估:它刻意把「策略想要、但資料不支撐」的動作的值往下壓,同時把資料中確實出現過的動作的值撐住。結果是一個對未知抱持悲觀態度的價值函數。

在一般的貝爾曼誤差之上,CQL 多加一個正則項:在當前策略的動作分布下把值最小化、在資料的動作下把值最大化。這可被證明會得到真實價值的一個下界,於是策略再也不會被灌水的分布外估計給騙去追逐。

CQL 是一匹好用的主力——容易接在現有的 Q 學習程式上,且在各種基準上都很強——但它的保守權重很敏感:太大就變得過度膽怯,太小高估又會滲回來。

\min_{Q}\ \alpha\Big(\mathbb{E}_{s\sim D,\,a\sim\pi}[Q(s,a)]-\mathbb{E}_{(s,a)\sim D}[Q(s,a)]\Big)+\tfrac{1}{2}\,\mathbb{E}_{D}\!\left[(Q-\mathcal{B}Q)^2\right]

壓低策略動作上的值、撐住資料動作上的值,再加上一般的貝爾曼誤差。

又称
CQL