貝氏深度學習

隨機梯度朗之萬動力學(SGLD)

一般的 SGD 一路下坡走向單一極小值。SGLD 在每一步加上精心校準劑量的高斯雜訊,使這趟走動永遠無法完全安定;反而在後驗周圍遊走,它造訪過的權重序列便成了一串相關的、來自參數後驗的樣本。它是最佳化與馬可夫鏈蒙地卡羅(MCMC)之間的橋樑。

Welling 與 Teh 的洞見是:若注入雜訊的變異數與步長相匹配,雜訊標準差等於兩倍步長的平方根,那麼當步長衰減時,SGLD 的更新會從類似 SGD 的最佳化,過渡為朗之萬擴散的離散化,其平穩分布正是後驗,而 Metropolis-Hastings 修正項變得可忽略。使用小批次梯度讓每一步都便宜,使它成為可擴展的 MCMC。

SGLD 是隨機梯度 MCMC 的基礎;後續方法加入動量(SGHMC)、預條件化與恆溫器。在深度網路中,主要的實務難題是混合(mixing):鏈在某個區域探索得很慢,而小批次梯度的雜訊又污染了精心調好的朗之萬雜訊,因此現實的取樣器需要很多步與謹慎的步長排程。

\Delta\theta_t=\frac{\epsilon_t}{2}\nabla\log p(\theta_t,\mathcal{D})+\eta_t,\qquad \eta_t\sim\mathcal{N}(0,\epsilon_t)

一步 SGD 式的更新加上尺度與步長綁定的高斯雜訊。

又称
SGLD隨機梯度朗之萬動力學