深度學習理論
線性模態連通性(linear mode connectivity)
線性模態連通性是模態連通性那位更強、更奇怪的表親。一般的模態連通性只保證兩個極小值之間有一條彎曲的低損失路徑。線性模態連通性主張:一旦你修正了網路的置換對稱,兩個獨立訓練出來的解就會被一條低損失的直線連接起來——你可以直接把它們的權重平均,幾乎不付出任何損失代價。
關鍵在於,網路有許多對稱:你可以打亂某個隱藏層裡神經元的順序、把權重相應地置換,卻計算出一模一樣的函數。兩個獨立的解通常看起來相距甚遠,只是因為它們用了不同、任意的神經元排序。找出最能把一個解對齊到另一個的置換——這正是 Git Re-Basin 與 Entezari 等人猜想背後的想法——對齊後權重之間的線性路徑就幾乎沒有損失障壁。少了這個對齊,天真的內插通常會穿過一道高障壁。
這把損失地景重新描繪成「在差一個對稱的意義下基本上是凸的」,並支撐了「以權重平均合併獨立訓練模型」的做法,應用範圍從聯邦學習,到便宜地組合多個微調後的檢查點。
低障壁只在置換對齊之後才出現;直接內插兩個未對齊的原始解,幾乎總會撞上一道損失障壁。
又稱
另見