JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

損失地景的幾何:連通性、坍縮與樂透彩券

好解的集合,遠比「非凸」這個詞暗示的更有結構。各極小值之間以低損失路徑相連,修正對稱後甚至是線性相連;末層特徵坍縮成優雅的單純形;而稠密網路裡藏著可訓練的稀疏子網路。

模式連通性:極小值不是孤島

用不同隨機種子把同一個架構訓練兩次,你會落在一個極度非凸損失地景(loss landscape)的兩個不同極小值。素樸直覺說,連接它們的直線會翻越一道高損失屏障——通常確實如此。模式連通性(mode connectivity)的驚奇之處在於:它們之間存在一條彎曲的路徑,沿途損失基本上保持平坦。這些極小值不是孤立的局部極小值(local minima);它們是同一個低損失流形上相連的節點。

在非凸損失曲面上滾下到一個極小值——隨機種子與初始點決定你落入哪個盆地。

一個小球在崎嶇的損失曲面上滾入若干極小值之一的互動演示。

這徹底重塑了我們對地景的理解。在高維中,解集更像一張相連的網,而不是一片各自獨立的隕石坑——這與「過度參數化開鑿出一條龐大、可穿行的內插山谷」一致。它也有實用回報:沿低損失曲線取樣的模型做集成,能廉價地獲得多樣性;而沿途平均權重(隨機權重平均(stochastic weight averaging))會落在更平坦、泛化更好的位置。

線性模式連通性與對稱的角色

彎曲路徑很好;直線路徑則更深刻。線性模式連通性(linear mode connectivity)問的是:兩個解之間的直線是否保持低損失。跨隨機種子時通常不會——直到你把置換對稱(permutation symmetry)考慮進來。網路的神經元可以重新貼標籤而不改變函數,所以兩個解可能是「同一個」點,只是透過不同的置換來看。把它們對齊(求解匹配的置換)之後,它們之間的直線路徑往往就變得無屏障了。

B(\theta_A,\theta_B)=\max_{\alpha\in[0,1]}\;\mathcal{L}\big(\alpha\,\theta_A+(1-\alpha)\,\theta_B\big)-\big[\alpha\,\mathcal{L}(\theta_A)+(1-\alpha)\,\mathcal{L}(\theta_B)\big]

兩個解之間直線上的損失壁壘;線性模式連通性意味著該壁壘接近於零。

由此引出的驚人猜想是:在置換意義下,SGD 的解可能活在單一個盆地裡——本質上只有一個極小值,只是穿上了許多對稱的戲服。這對模型合併(model merging)有直接的可操作性:把一個模型置換到另一個的座標系,你就能把獨立訓練的網路平均成一個能用的模型,無需重新訓練。對稱不是麻煩,它是損失地景隱藏的座標系。

神經坍縮:訓練最末端的幾何

把一個分類器訓練到遠超過零誤差,進入末期階段(terminal phase),末層的幾何會結晶成出奇剛性的結構。神經坍縮(neural collapse)是四個耦合現象的集合:類內特徵變異消失(一個類別的每個樣本都映到它的類別均值);類別均值排成一個最大分離的單純形等角緊框(simplex equiangular tight frame);末層分類器權重與這些均值對齊(自對偶性);而分類退化成最近類別均值。

\cos\angle\!\big(\mu_c-\mu_G,\;\mu_{c'}-\mu_G\big)=\frac{K\,\delta_{cc'}-1}{K-1}

神經坍縮:去中心化的類別均值變得等角且最大程度分離,構成單純形等角緊框架。

為什麼要在意?坍縮是一個乾淨、可在數學上推導的終點——它從「在可分特徵上以權重衰減最小化交叉熵」中自然掉出來——並暗示網路最終落定的表徵,更多是由損失幾何決定,而非資料細節。它連結到泛化、遷移(坍縮後的特徵因為極度任務專精,遷移可能更差),甚至連結到不平衡學習——單純形會以可預測的方式扭曲。

樂透彩券:稠密網路裡藏著的稀疏子網路

再來一塊結構。樂透彩券假說(lottery ticket hypothesis)主張:一個隨機初始化的稠密網路裡,含有一個稀疏子網路——一張「中獎彩券」——它若從原始初始化單獨訓練,就能匹配完整網路的準確度。找到它的方法是:訓練、剪枝(pruning)掉量值最小的權重,然後把存活下來的權重回繞(rewind)到它們原始(或早期)的值,而不是重新初始化。

f\big(x;\,m\odot\theta_0\big),\qquad m\in\{0,1\}^{d},\quad \lVert m\rVert_0\ll d

中獎彩票是稀疏遮罩與回退初始化的特定配對,單獨訓練即可匹配稠密網路。

W = init()                      # keep a copy of the original weights
for round in range(N):
    train(W)
    mask = keep_top_magnitude(W, sparsity)   # prune smallest weights
    W = init_copy * mask        # REWIND survivors to original init
搭配權重回繞的迭代量值剪枝——讓中獎彩券浮現的配方。

「回繞、別重新初始化」這個細節是關鍵:真正中獎的是遮罩與初始化的特定配對,這說明那個幸運結構在訓練極早期(甚至訓練之前)就已被設定。和連通性與坍縮一起讀,樂透彩券完成了本章的論點:過度參數化網路的解集,不是混亂的非凸泥沼,而是一個結構豐富的物件——相連、對稱、有稀疏核心,且在終點處幾何剛性。