深度學習理論
模態連通性(mode connectivity)
用不同的隨機種子把一個網路訓練兩次,你會落在兩個看似孤立的不同極小值裡,每個都被高損失包圍。模態連通性是個令人意外的發現:它們其實一點也不孤立——你通常能在權重空間中畫出一條彎曲的路徑連接這兩個解,而沿途的損失自始至終都保持得很低。這些盆地其實是通往同一個相連低損失區域的門。
具體做法是,在兩個訓練好的權重向量之間配適一條簡單曲線——一條二次貝茲曲線,或一條帶幾個自由節點的分段線性路徑——並最佳化那些節點,使沿路徑的損失維持在接近端點的水準。Garipov 等人與 Draxler 等人證明這種低損失曲線經常存在,意味著「好解的集合」與其說是分散的孤立點,不如說是一個相連的流形。相對地,在兩個極小值之間天真地畫一條直線,通常會穿過一道損失障壁。
除了重塑損失地景的圖像,模態連通性還有實際的回報:沿連接路徑取樣多個模型來做集成,以及利用這個平坦相連區域的權重平均方法,兩者都能改善泛化。
又稱
另見