深度強化學習基礎

用於探索的噪聲網路(noisy networks for exploration)

多數 DQN 智能體用 epsilon-貪婪來探索:大多時候貪婪行動,但以某個機率擲硬幣、隨機做點什麼。它有效,卻很粗糙——隨機性到處都一樣,無視某個狀態是早已理解還是真正新奇,而且必須手動排程讓它隨時間衰減。噪聲網路把這種外加的隨機性,換成烘焙進網路本身的探索。

它的想法是給網路的權重加上可學習的噪聲:每個權重都有一個平均值和一個噪聲尺度,每次前向傳播都抽取並注入隨機擾動。一開始噪聲很大,於是智能體的動作多變、進行探索;隨著學習推進,梯度下降可以在信心高之處縮小噪聲,在智能體仍不確定之處保留噪聲。探索於是變成依狀態而定、自我調節,是學出來的而非排程出來的。噪聲網路是 Rainbow 六種成分之一,在難探索的遊戲上常勝過 epsilon-貪婪。

又称
NoisyNet