深度學習理論

神經網路高斯過程(neural network Gaussian process, NNGP)

拿一個權重隨機的網路,完全不訓練它——只觀察它對所有可能輸入所產生的輸出。當各層變得無限寬時,這些輸出會變成聯合高斯分佈:隨機初始化的網路,恰好就是一個從高斯過程抽出的樣本。這個對應關係——神經網路高斯過程(NNGP)——把一個深層架構化為一個你能寫成封閉形式的協方差核。

理由是把中央極限定理逐層套用。每個預激活值都是許多獨立隨機貢獻的總和,因此在寬極限下趨於高斯,而兩個輸入之間的協方差會透過網路、依一個由激活函數與權重變異數所決定的確定性遞迴一路傳播。用這個核做貝氏推論,可以重現一個無限寬貝氏神經網路的精確後驗,過程中完全不涉及梯度訓練。

NNGP 是 NTK 的靜態版本——對應的是初始化時刻與貝氏的那一面。NNGP 核描述的是函數的先驗與後驗;NTK 描述的是梯度下降如何移動一個函數。把這兩者分清楚,是任何認真讀無限寬理論的人首先必須做到的事。

K^{(\ell)}(x,x') = \sigma_w^2\, \mathbb{E}_{f\sim\mathcal{GP}(0,K^{(\ell-1)})}\!\left[\phi(f(x))\,\phi(f(x'))\right] + \sigma_b^2

NNGP 核由一個穿過非線性 φ 的逐層遞迴建構;每一層的協方差餵給下一層。

又称
NNGP神經網路高斯過程