JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

還原動機:逆向強化學習

與其複製專家做了什麼,不如推論出能解釋其行為的獎勵——然後自己去最佳化那個獎勵。這就是逆向強化學習。

從複製動作到推論意圖

行為克隆回答的是「專家在這裡採取了什麼動作?」。逆向強化學習(inverse reinforcement learning, IRL)問的是更深層的問題:「什麼目標能讓這個行為顯得最優?」。IRL 不直接學策略,而是學專家似乎正在最大化的那個獎勵函數。一旦取得獎勵,你就能在它之上跑普通的強化學習,藉此還原——甚至超越——專家。

标准的智能体–环境循环:逆强化学习保留这个循环,却把奖励信号当作待推断的未知量。

智能体在环境中采取动作并接收状态与奖励的示意图。

這樣做的回報是泛化能力。克隆出的策略在專家從未造訪的狀態上就失靈;相對地,還原出的獎勵函數是一份對意圖的精煉陳述,能遷移到新的動態、新的起始狀態,甚至新的身體:像「到達目標的同時保持直立」這樣的獎勵,即使換了機器人依然成立。

界定 IRL 問題

把它放進一個馬可夫決策過程(Markov decision process)裡,其動態你(大致)已知,但獎勵未知。你拿到一批假設接近最優的專家軌跡。任務是:找到一個獎勵函數,使專家策略在它之下的得分不低於任何替代策略。早期的表述把它寫成一組線性約束——「專家必須勝過其他每一個策略」——並搜尋滿足這些約束的獎勵。

一個標準的簡化假設獎勵是狀態之特徵(features)的線性組合:r(s) = wᵀφ(s),其中 φ(s) 可能編碼了「與目標的距離」、「速度」、「碰撞風險」等。如此一來,學獎勵就化約為學權重向量 w——一個小得多、也更易處理的目標。

r(s) = w^\top \phi(s)

线性奖励模型:每个状态的奖励是其特征的加权和,于是学习奖励就归结为学习权重向量 w。

學徒學習與特徵匹配

學徒學習(apprenticeship learning)把 IRL 重新框定在一個乾淨的目標上:別堅持還原真正的獎勵,只要產出一個在所選獎勵族中的任意獎勵之下,表現都不輸專家的策略就好。關鍵工具是特徵期望(feature expectation)——一個策略隨時間累積的特徵 φ 的折扣平均。

若獎勵是特徵的線性組合,則兩個特徵期望相等的策略在每一個權重向量之下都有相等的價值。於是特徵期望匹配(feature-expectation matching)把「模仿專家」轉化為「讓我的特徵期望等於專家的」。演算法交替進行:先猜一個能最大程度把當前策略與專家拉開的獎勵,跑強化學習去最佳化它,再量測新策略的特徵期望,如此反覆,直到與專家相符。

逆强化学习在内层循环中嵌套一个正向强化学习求解器——探索这个 Q 学习网格世界,看看候选奖励诱导出的策略。

交互式网格世界,Q 学习从奖励函数中找出策略。

獎勵模糊性:核心難題

反問題在此反咬一口。許多不同的獎勵都同樣能解釋同一批示範——包括那個處處為零的退化獎勵,在它之下每一個策略(包含專家的)都平凡地最優。這就是獎勵模糊性(reward ambiguity),若沒有額外假設,IRL 無法從這個龐大的等價類中挑出「對的」獎勵。

實用的 IRL 方法用一個偏好原則來消解模糊性——一條從眾多獎勵中選出其一的決勝規則。基於間隔(margin)的方法偏好那些能讓專家以最大幅度勝過替代方案的獎勵。而最具影響力的決勝規則是最大熵:它挑出既能解釋資料、又對額外假設承諾最少的那個獎勵——這正是下一篇的主題。

IRL 對比模仿:何時用哪一個

這個區別歸結於你學的是什麼。模仿(行為克隆、DAgger)直接學策略:便宜、快速,但對分布偏移很脆弱,也無法超越專家。IRL 先學獎勵、再學策略:昂貴(每次迭代內都嵌著一次強化學習求解),但換來一個能跨環境遷移的意圖,並能支撐一個勝過次優專家的代理人。

RLHF 是逆强化学习的实用近亲:它从人类偏好中恢复奖励,再调优策略以最大化该奖励。

流程图:人类偏好训练奖励模型,再由其指导策略调优。