從觀察中學習:沒有動作標籤
目前為止的一切都假設你能讀到專家的動作。但最豐富的示範來源——人類與動物的影片——只給你狀態:你看到籃球進框,卻看不到精確的肌肉扭矩。從觀察中學習(learning from observation, LfO)處理的正是「動作不可觀察」時的模仿。
有兩個主導想法。其一是學一個逆向動態模型(inverse dynamics model),用來推論「什麼動作能把你從這個狀態帶到下一個?」,再用猜出的動作為純觀察示範貼標籤,然後退回到行為克隆。其二是匹配專家所產生的狀態轉移分布——這是 GAIL 的純觀察表親,其鑑別器比較的是狀態對 (s, s′) 而非狀態–動作對。
逆动力学模型根据相邻两个状态推断出中间的动作,从而为只有状态的演示补上动作标签。
單次模仿
單次模仿學習(one-shot imitation learning)追求極致的資料效率:看一個前所未見任務的單次示範,便能立刻執行它。訣竅是根本不去學單一任務,而是跨一大族相關任務做元學習(meta-learning),讓模型習得一種通用技能——「以一個示範為條件、然後行動」——而非單一策略。
部署時,示範被當成情境(context)餵入:策略對它做注意力運算,並泛化到新的實例,很像語言模型遵循一個情境內範例。單次模仿正是模仿學習與「少樣本、提示驅動泛化」交會之處——也是當今「以一個示範或指令為輸入」的通用型機器人策略的直系祖先。
交互式自注意力:点击一个词,查看它关注哪些其他词。
示範引導式強化學習:模仿加上獎勵
純模仿讓你的上限卡在專家;而當獎勵稀疏時,從零開始的純強化學習又可能慢得無望。示範引導式強化學習(demonstration-guided RL)把兩者融合:用示範來啟動探索、形塑早期學習,再讓真正的獎勵把代理人推到超越專家。示範回答「我到底該從哪開始?」;獎勵回答「我要怎麼變得比老師更強?」。
演示引导的强化学习优化一个混合目标:模仿项让策略贴近演示,加权的强化学习项则突破专家的上限。
- 暖啟動。先用行為克隆預訓練策略,讓代理人從接近勝任的行為開始,而非隨機亂動。
- 播種緩衝區。把示範注入回放緩衝區(replay buffer),讓代理人在離線策略的強化學習更新中反覆回顧專家轉移。
- 混合目標。把模仿損失與強化學習損失結合,再逐步退火模仿權重,讓獎勵漸漸接手,使代理人得以超越次優的專家。
基於偏好的獎勵學習
有時你根本無法示範——你沒辦法示範機器人怎麼後空翻——但你能判斷兩次嘗試中哪一次看起來更好。基於偏好的獎勵學習(preference-based reward learning)正是利用這一點。給人類看成對的軌跡片段,蒐集「A 比 B 好」的比較,再擬合一個「分數與這些偏好相符」的獎勵模型,然後用普通強化學習去最佳化這個學出來的獎勵。
示意图:人类在两个输出之间的偏好喂给奖励模型,再由其微调策略。
比較式回饋通常比「示範」或「手寫獎勵」都更容易、更可靠——判斷比動手便宜,而且帶雜訊的比較仍承載訊號。這條流程是基於偏好的強化學習(preference-based RL)的概念核心;放大到語言模型上,它就是基於人類回饋的強化學習(RL from human feedback, RLHF)——透過把人類偏好轉化為獎勵來對齊當代 AI 助理。