連續控制
MuJoCo 基準測試(MuJoCo benchmarks)
MuJoCo 是一個快速又精準的物理模擬器(名稱代表「含接觸的多關節動力學」),而建立其上的那套標準任務,已成為連續控制演算法事實上的試煉場。這些就是你在每篇論文都會看到的模擬生物:HalfCheetah、Hopper、Walker2d、Ant、Humanoid。每個都給智能體一具有關節的身體、一份位置與速度的觀測,以及「向前移動而不跌倒」的獎勵。
它們的價值在於可比較性。因為大家都跑同樣的模擬機器人、用同樣的獎勵定義,新演算法就能在完全相同的場地上對 DDPG、TD3、SAC、PPO 做評比,學習曲線可直接對照。它們夠難,足以把好方法與壞方法分開——尤其 Humanoid 是貨真價實的挑戰——卻又夠便宜夠快,能跑上幾千次,這讓深度連續控制的快速進展成為可能。
值得誠實點出的提醒是:它們是模擬,觀測乾淨、沒有感測雜訊,獎勵函數也是人工調到可學的。MuJoCo 分數亮眼,並不保證方法能轉移到真實機器人——那裡接觸雜亂、感知困難。它們衡量的是控制問題上的演算法進展,而非對物理世界的就緒程度——這也是為何「模擬到真實」是另一個獨立的課題。
又稱
另見