JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

還原動機:逆向強化學習

與其複製專家做了什麼,不如推論出能解釋其行為的獎勵——然後自己去最佳化那個獎勵。這就是逆向強化學習。

從複製動作到推論意圖

行為克隆回答的是「專家在這裡採取了什麼動作?」。逆向強化學習(inverse reinforcement learning, IRL)問的是更深層的問題:「什麼目標能讓這個行為顯得最優?」。IRL 不直接學策略,而是學專家似乎正在最大化的那個獎勵函數。一旦取得獎勵,你就能在它之上跑普通的強化學習,藉此還原——甚至超越——專家。

標準的智能體–環境迴圈:逆強化學習保留這個迴圈,卻把獎勵訊號當作待推斷的未知量。

智能體在環境中採取動作並接收狀態與獎勵的示意圖。

這樣做的回報是泛化能力。克隆出的策略在專家從未造訪的狀態上就失靈;相對地,還原出的獎勵函數是一份對意圖的精煉陳述,能遷移到新的動態、新的起始狀態,甚至新的身體:像「到達目標的同時保持直立」這樣的獎勵,即使換了機器人依然成立。

界定 IRL 問題

把它放進一個馬可夫決策過程(Markov decision process)裡,其動態你(大致)已知,但獎勵未知。你拿到一批假設接近最優的專家軌跡。任務是:找到一個獎勵函數,使專家策略在它之下的得分不低於任何替代策略。早期的表述把它寫成一組線性約束——「專家必須勝過其他每一個策略」——並搜尋滿足這些約束的獎勵。

一個標準的簡化假設獎勵是狀態之特徵(features)的線性組合:r(s) = wᵀφ(s),其中 φ(s) 可能編碼了「與目標的距離」、「速度」、「碰撞風險」等。如此一來,學獎勵就化約為學權重向量 w——一個小得多、也更易處理的目標。

r(s) = w^\top \phi(s)

線性獎勵模型:每個狀態的獎勵是其特徵的加權和,於是學習獎勵就歸結為學習權重向量 w。

學徒學習與特徵匹配

學徒學習(apprenticeship learning)把 IRL 重新框定在一個乾淨的目標上:別堅持還原真正的獎勵,只要產出一個在所選獎勵族中的任意獎勵之下,表現都不輸專家的策略就好。關鍵工具是特徵期望(feature expectation)——一個策略隨時間累積的特徵 φ 的折扣平均。

若獎勵是特徵的線性組合,則兩個特徵期望相等的策略在每一個權重向量之下都有相等的價值。於是特徵期望匹配(feature-expectation matching)把「模仿專家」轉化為「讓我的特徵期望等於專家的」。演算法交替進行:先猜一個能最大程度把當前策略與專家拉開的獎勵,跑強化學習去最佳化它,再量測新策略的特徵期望,如此反覆,直到與專家相符。

逆強化學習在內層迴圈中嵌套一個正向強化學習求解器——探索這個 Q 學習網格世界,看看候選獎勵誘導出的策略。

互動式網格世界,Q 學習從獎勵函數中找出策略。

獎勵模糊性:核心難題

反問題在此反咬一口。許多不同的獎勵都同樣能解釋同一批示範——包括那個處處為零的退化獎勵,在它之下每一個策略(包含專家的)都平凡地最優。這就是獎勵模糊性(reward ambiguity),若沒有額外假設,IRL 無法從這個龐大的等價類中挑出「對的」獎勵。

實用的 IRL 方法用一個偏好原則來消解模糊性——一條從眾多獎勵中選出其一的決勝規則。基於間隔(margin)的方法偏好那些能讓專家以最大幅度勝過替代方案的獎勵。而最具影響力的決勝規則是最大熵:它挑出既能解釋資料、又對額外假設承諾最少的那個獎勵——這正是下一篇的主題。

IRL 對比模仿:何時用哪一個

這個區別歸結於你學的是什麼。模仿(行為克隆、DAgger)直接學策略:便宜、快速,但對分布偏移很脆弱,也無法超越專家。IRL 先學獎勵、再學策略:昂貴(每次迭代內都嵌著一次強化學習求解),但換來一個能跨環境遷移的意圖,並能支撐一個勝過次優專家的代理人。

RLHF 是逆強化學習的實用近親:它從人類偏好中恢復獎勵,再調校策略以最大化該獎勵。

流程圖:人類偏好訓練獎勵模型,再由其指導策略調校。