模仿學習與逆向強化學習

示範引導的強化學習(demonstration-guided RL)

示範引導的強化學習兼取兩邊的長處:用少量示範快速起步,再讓智能體靠真正的獎勵超越它們而持續進步。純模仿永遠贏不過示範者,純強化學習則可能在困難任務裡瞎忙很久才偶然碰到獎勵;把兩者結合,就得到一個單靠探索得花上極久才能找到的暖身起點。

常見作法包括:用專家轉移為經驗回放緩衝區播種、加入一個模仿損失使策略在早期貼近示範並在智能體變強後逐漸淡出,或用示範來塑形獎勵、把探索偏向有希望的區域。智能體先學會大致模仿,接著由強化學習打磨,最終在真正的目標上超越示範者。

這是稀疏獎勵與安全敏感問題的實用甜蜜點——機器人、遊戲對局、對話微調——在這些場景中示範取得得起卻不完美,而獎勵雖然稀少,卻正是你真正在乎的東西。

又称
RL from demonstrationsRLfDDQfD-style learning