強化學習理論
保守 Q 學習(conservative Q-learning, CQL)
保守 Q 學習針對離線強化學習的核心病灶:對從未真正見過的動作過度樂觀的 Q 函數。CQL 刻意把分布外(out-of-distribution)動作的 Q 值往下壓,使策略不會被誘去追逐一個其實只是外推幻想出來的大獎。
在一般的貝爾曼誤差之上,它加入一個正則項:在某個寬廣或學習而來的動作分布下最小化期望 Q,同時在資料集中實際出現的動作上最大化 Q。淨效果是:缺乏支撐之動作的價值會相對於分布內動作被壓低,且學到的 Q 可被證明為真值的下界,給出一個保守估計。一個權衡權重決定悲觀的強度。
由於它對策略價值給出下界,CQL 是離線控制的主力方法。代價是:權重設得太大會得到過度膽怯的策略,連那些確實不錯但鮮少被觀察到的動作也一併忽略。
\min_{Q}\ \alpha\Big(\mathbb{E}_{s\sim\mathcal{D},a\sim\mu}[Q(s,a)]-\mathbb{E}_{(s,a)\sim\mathcal{D}}[Q(s,a)]\Big)+\tfrac12\,\mathbb{E}_{\mathcal{D}}\big[(Q-\mathcal{B}^{\pi}Q)^2\big]
在一般貝爾曼誤差之外,對取樣到的分布外動作壓低 Q、對資料集動作抬高 Q。
CQL 的保守性是保證而非啟發法:學到的 Q 為真值下界,因此據其做的策略改善不會被往上誤導。
又稱
另見