深度學習理論

過參數化與內插(overparameterization and interpolation)

給一個網路遠多於訓練樣本數的參數,它就能把訓練損失一路壓到零、把每一個點都精準配適——也就是內插這些資料。古典統計把這視為危險地帶。現代深度學習卻發現恰恰相反:這個過參數化、內插的區制,正是最佳化變得容易、而且在恰當的隱式偏好下、泛化最好的地方。

當參數遠多於樣本時,全域極小值的集合不是寥寥幾個孤立點,而是一個高維的相連流形,而損失往往滿足某種 Polyak-Lojasiewicz 型的條件,讓梯度下降不至於陷住、就能抵達全域極小值——這正是神經正切核分析所形式化的東西。內插本身會令人警覺,但最佳化器並不是隨便挑一個內插解;它的隱式正則化會挑出一個平滑、低範數的解,這就是為什麼「配適一切」未必意味著「過度擬合」。

過參數化與內插是現代深度學習理論的結締組織,把雙重下降、良性過擬合、隱式正則化,以及懶惰區制對比特徵學習區制全都串在一起。長存的提醒是:內插之所以無害,是因為那個隱式偏好與有利的資料幾何,而不是因為記住資料本身就安全。

又称
overparameterization過參數化interpolation regime