應用、環境與模擬到真實

領域適應(domain adaptation,RL)

領域適應處理的情況是:你在一個設定下訓練——某個模擬器、或某一台特定機器人——如今卻必須在一個相關但不同的設定下運作,例如真實世界或一台新機器人。與其從零重訓,你把已經學會的技能適應到新領域。

常見做法是讓兩個領域對齊,使策略分不出彼此:學出對落差不變的特徵、把觀測翻譯成讓算繪影像看起來像真實(或反過來),或用少量目標領域資料微調策略。目標是重用技能,而只替換掉那些倚賴領域特有表面細節的部分。

適應的前提是任務本質相同,只有領域不同。如果新領域改變了底層動力學或獎勵本身,光靠適應救不了你——你面對的其實是一個新問題,需要的遠不只是表面的對齊。

又称
transfer across domainspolicy adaptation