深度學習理論
神經網路的平均場理論(mean-field theory of neural networks)
與其逐一追蹤一個寬的兩層網路裡的每個神經元,不如把它們想像成一大群族群,問整個族群在訓練過程中如何移動。在平均場極限下,關鍵的對象是神經元參數的分佈,而學習就變成那個分佈的流動——像一團粒子在損失所施加的力作用下漂移。單一網路被換成了一個定義在神經元上的機率測度。
其機制取決於一個尺度選擇:把每個神經元的輸出乘上「神經元數的倒數」,而不是「其平方根的倒數」。在這個正規化下,當寬度增長時,參數的經驗分佈會依一個 Wasserstein 梯度流演化——等價於一個非線性的連續方程式 PDE——使被視為分佈泛函的損失下降。關鍵在於:神經元是真的會移動的,因此特徵在訓練中確實會自我調整。
這正是它與神經正切核之間決定性的對比。NTK 的懶惰區制把特徵凍結;平均場區制讓特徵學習,這就是為什麼它既能證明全域收斂,又能建模那個讓深層網路有效的特徵學習。代價是:平均場分析主要在兩層架構上才精確。
平均場(1/N 尺度)帶來特徵學習;NTK(1/√N 尺度)帶來凍結的懶惰區制——尺度選擇決定了你身處哪一個世界。
又称
另见