表徵與自監督學習

VICReg(變異-不變-共變正則化)

VICReg 把「不崩潰的自監督」這份配方寫得明明白白,將損失拆成三個有名字的成分。不變性把一張影像的兩個視圖拉近;變異性讓每個嵌入維度不致縮成常數;共變性讓各維度不致攜帶相同資訊。三者合起來用白話說就是:對「增強不該改變什麼」達成共識,但要保持鋪開且去相關。

變異項對「沿批次、逐維度的標準差」施加一個鉸鏈,只要它低於目標值(通常為一)就懲罰,這正是顯式的抗崩潰力。共變項懲罰每一分支共變矩陣的非對角項平方,使特徵去相關。不變項就是兩嵌入之間單純的均方距離。對兩個分支同時施加這三者的加權和,就是全部的目標——沒有負樣本、沒有動量、沒有停止梯度。

由於這三項都在各分支內獨立計算(變異與共變從不比較兩個網路),VICReg 並不要求兩分支相同、甚至不必共用架構,這使它很適合跨模態的配對。最好把它理解為 Barlow Twins 的姊妹:兩者都靠正則化嵌入的統計量來阻止崩潰,而非靠對著負樣本做對比。

\mathcal{L} = \lambda\, s(Z,Z') + \mu\,[v(Z)+v(Z')] + \nu\,[c(Z)+c(Z')]

不變項 s、變異項 v、共變項 c,以 \lambda,\mu,\nu 加權。

變異鉸鏈是最直接禁止常數解的那一項;拿掉它,光靠不變項會樂於把一切都崩成一個點。

又称
VICRegvariance-invariance-covariance regularization變異-不變-共變正則化