離線強化學習

優勢加權回歸(advantage-weighted regression, AWR)

優勢加權回歸是「有品味的行為克隆」。它不再對每個記錄下的動作一視同仁地模仿,而是按照它們最後表現的好壞來模仿——高優勢的動作用力學,差的就降低權重。你學會去模仿自己資料中比較好的那一半。

它是一個加權的最大似然更新:策略最大化資料集動作的對數似然,每一項都乘上其估計優勢的指數加權。這恰好是「KL 約束下的策略改良步驟」的封閉解,這也正是它為何天生就會貼著行為策略走。

這個簡單又穩定的配方,是許多離線與離線轉線上方法的底層,包括 AWAC,以及 IQL 萃取策略的那一步。它的天花板一樣是資料:它替既有動作重新加權,卻從不提出真正全新的動作。

\pi^*(a\mid s)\ \propto\ \pi_\beta(a\mid s)\,\exp\!\left(\tfrac{1}{\lambda}A(s,a)\right)

模仿資料,但每個動作都按其優勢的指數來加權。

又称
AWRadvantage-weighted actor-criticAWAC