深度學習理論

神經正切核(neural tangent kernel, NTK)

拿一個非常寬的網路,用梯度下降來訓練。神經正切核(NTK)告訴我們:在無限寬的極限下,網路所計算的函數幾乎不會偏離它在初始點附近的一階泰勒展開。於是訓練的行為就像用一個固定核的核迴歸——幾何在你開始的那一刻就被凍結了,學習只是在一個你其實從未移動過的高維特徵空間裡求解一個線性問題。

具體來說,把核定義為輸出對參數的梯度在兩個輸入上的內積。在 NTK 參數化下、當寬度趨於無限時,這個核在初始化時是確定性的,並在整個訓練過程中保持不變。對平方損失做梯度下降就化為一個線性常微分方程——核梯度流——而訓練後的預測子會收斂到核(無嶺)迴歸的解。這為極度過參數化的網路提供了乾淨的全域收斂保證。

問題在於:核保持不變的這個區制,正好就是沒有特徵學習的區制——網路的內部表徵不會自我調整。深度學習在實務上的威力有很大一部分落在這個「懶惰」區制之外,因此 NTK 最好被理解為一個可解析的邊界情形:它解釋了可訓練性,卻悄悄略過了讓有限、會學特徵的網路真正特別的那部分。

\Theta(x,x') = \nabla_\theta f(x;\theta_0)^\top \nabla_\theta f(x';\theta_0)

NTK 是初始化時的梯度內積;在無限寬極限下,它於訓練期間維持固定。

NTK 描述的是梯度訓練的動力學;NNGP 核描述的是初始化的分佈。兩者只在特殊情形下重合——不要混為一談。

又稱
NTK神經正切核lazy training