表徵與自監督學習
Barlow Twins(巴洛雙生)
Barlow Twins 的名稱與原理都來自神經科學家 Horace Barlow 的想法:感官系統應該減少冗餘。它不是把樣本互相比較,而是把嵌入的各個維度互相比較。目標是得到一個嵌入,其每個分量都對增強穩健,卻又攜帶互不重疊的資訊——既不變又不冗餘。
一個批次的兩個增強視圖被編碼並投影,接著計算兩視圖嵌入之間(沿批次、逐維度)的經驗交叉相關矩陣。目標把此矩陣推向單位矩陣:對角元被推向一,使每個特徵對增強不變;非對角元被推向零,使特徵去相關,讓不同維度編碼不同的東西。一個冗餘削減權重 λ 在這兩部分之間取捨。
它的吸引力在於概念上的簡省:沒有負樣本對、沒有動量編碼器、沒有停止梯度、沒有預測器,且對批次大小相對不敏感。崩潰是被結構性地阻止的——崩潰成常數的嵌入無法讓非對角相關消失——這使 Barlow Twins 與 VICReg、白化同屬「資訊最大化」一族,而非「實例對比」一族。
\mathcal{L} = \sum_i (1-C_{ii})^2 + \lambda \sum_i \sum_{j\ne i} C_{ij}^2
把交叉相關矩陣 C 推向單位矩陣。
它需要高維的投影器輸出:唯有維度夠多可供去相關時,非對角去相關才有空間把資訊鋪開。
又称
另见