應用、環境與模擬到真實

領域隨機化(domain randomization)

與其打造一個完美的模擬器,不如打造成千上萬個不完美的——隨機化質量、摩擦、光照、材質與感測延遲——再逼一個策略在它們全部之上都能成功。如此一來,真實世界看起來就只是策略早已學會應付的、又一個隨機變體。

在每個回合開始時,你從選定的範圍裡抽樣物理與視覺參數。只要這些範圍夠寬、能把真實情況包夾在內,訓練出的策略就會把真實世界當成分布內的情形,因而變得穩健。視覺隨機化幫助以相機為輸入的策略;動力學隨機化幫助控制;自動領域隨機化則隨著智能體變強而把範圍逐步加寬。

隨機化太多,任務會難到讓智能體只敢學一個過度保守、表現平庸的策略;太少,真實世界又會落到訓練分布之外。把範圍挑得恰到好處本身就是一門手藝,常常就是遷移成功與失敗的分野。

又称
dynamics randomizationvisual randomization