離線強化學習
隱式 Q 學習(implicit Q-learning, IQL)
隱式 Q 學習乾脆繞開「沒見過的動作」這整個問題:它根本不去問它們。貝爾曼目標裡那個「對所有動作取最大值」,正是分布外動作鑽進來的地方;IQL 拒絕取那個最大值,改用期望分位數回歸(expectile regression)來估計資料中既有的最佳動作的價值。
它學一個狀態價值,使其成為該狀態下所見動作價值的一個高階期望分位數,藉此逼近「樣本內的最大值」,而完全不必去評估資料以外的任何動作。接著再用優勢加權的行為克隆萃取出策略。動作價值永遠只在資料動作上被查詢。
因為它碰不到任何分布外動作,IQL 出奇地穩定,也免去了顯式的約束或保守懲罰。代價是表現力:它的天花板就是資料所含的內容,因為它只能把確實見過的動作縫接起來。
L_V=\mathbb{E}_{(s,a)\sim D}\!\left[L_2^{\tau}\!\left(Q(s,a)-V(s)\right)\right],\quad \tau\to 1
期望分位數回歸把 V 拉向 Q 的樣本內最大值;從不查詢任何樣本外動作。
又稱
另見