連續控制
從像素學連續控制(continuous control from pixels)
多數連續控制成果都假設智能體拿到的是乾淨狀態——精確的關節角度與速度。從像素學連續控制拿掉了這根拐杖:智能體只看到原始相機影像,就像真實機器人那樣,並且必須單憑獎勵,同時學會「感知自己處於什麼狀態」與「如何行動」。動作仍是連續的(關節扭矩),但如今一個卷積網路得先從像素裡萃取出相關幾何,任何控制器才用得上。
這比從狀態學困難得多。影像維度很高,而每一幀大部分都無關緊要;獎勵訊號對「學一個好的視覺表徵」這件重活而言是個單薄的老師;而像 SAC 這類離策略方法,當編碼器與價值函數一起學時會變得不穩。突破性的配方是大力倚靠資料增強——隨機平移或裁切輸入影像——以及自監督的輔助損失,讓編碼器有遠多於獎勵的東西可學。
諸如「配合增強的影像版 SAC」,以及對比式或重建式的表徵學習等方法,最終在標準基準上直接從像素達到了與「從狀態學」相當的表現——這是一座里程碑,因為真實機器人鮮少被遞上乾淨狀態。它把連續控制連到了表徵學習,也是邁向「在雜亂真實世界而非整潔模擬器中感知並行動的智能體」的一塊踏腳石。
又稱
另見