表徵與自監督學習
自監督中的白化
基於白化的方法以統計學家的方式防止崩潰:強制把一個批次的嵌入標準化,使其均值為零、變異數為一、且維度間相關為零——也就是白化後的分布。一旦嵌入被白化,它們在數學上就不可能全部崩到一點、或崩進一個低維子空間,於是你便能安心地把正樣本對拉近,完全不需要任何負樣本。
具體而言,W-MSE 之類的方法會計算批次的共變矩陣,求出一個白化變換(例如透過對逆共變矩陣做 Cholesky 分解),把它套用到嵌入上,然後才去最小化白化後正樣本對之間的均方距離。白化操作是可微的,且內建於前向傳遞中,因此它每一步都作為一個硬約束,而非軟性懲罰。這使白化與 Barlow Twins、VICReg 同屬資訊最大化一族,但它是透過一個線性變換精確地施加去相關,而非透過一個損失項近似地施加。
實務上的提醒屬於統計性質。共變矩陣必須由當前批次估計,因此白化需要相當大的批次才穩定,而計算或反轉共變矩陣會增加成本、且在數值上可能脆弱。換來的是一個乾淨、免負樣本的目標,並對崩潰握有一個結構性的——而非僅僅被鼓勵的——保證。
白化透過一個變換精確地施加去相關,而 Barlow Twins 與 VICReg 只用懲罰項把共變矩陣輕推向它——目標相同,差在硬約束與軟約束。
又称
另见