連續控制
Ornstein–Uhlenbeck 雜訊(Ornstein–Uhlenbeck noise)
像 DDPG 那樣的確定性策略只輸出單一動作、自身從不探索,所以探索得靠對那個動作加雜訊來注入。最天真的做法是每一步都用全新獨立的隨機雜訊,但在物理控制裡這會產生沒用的抖動:智能體前後抽搐、幾乎哪都去不了,因為每一推都被下一推抵消。Ornstein–Uhlenbeck 雜訊的解法是讓它在時間上相關——今天的雜訊記得昨天的。
OU 雜訊來自一個簡單的隨機過程:它一邊被隨機推擠、一邊往零漂回,所以是以平滑而持續的遊走方式擺動,而非閃爍。用在機器人上,意思是朝某方向持續輕推一陣子,再換另一個方向——是真正能走到地方的探索,像穩穩踩著油門而非點放。這個過程有兩顆旋鈕:往零拉回的力道,以及隨機推擠的大小。
OU 雜訊是原始 DDPG 論文的招牌成分,很適合具有動量與慣性的系統。有趣的是,後來的研究發現對許多任務而言,純粹無相關的高斯雜訊一樣管用,於是 TD3 與 SAC 大多捨棄 OU,改用更簡單的雜訊或內建的隨機性。它仍值得認識,作為「為何相關探索在控制裡可能重要」的一個乾淨範例。
又称
另见