自監督與表徵學習
BYOL
BYOL(Bootstrap Your Own Latent,自助式潛在表徵)是個令人意外的結果:完全不用負樣本、只靠拉近正樣本,竟也能學到極佳的表徵。這原本被認為不可能:只有吸引力而無排斥力,網路理應崩潰成對每張影像都輸出同一個常數向量。BYOL 避開了這點,而「它如何避開」成了此領域最受研究的問題之一。其名稱點出核心想法:模型自助(bootstrap),透過試著預測自己稍早版本對另一視角的表徵來學習。
其架構刻意不對稱。系統有兩個網路:一個線上網路(編碼器、投影器,以及一個小型額外的預測器頭),以梯度下降訓練;以及一個目標網路(編碼器與投影器,但沒有預測器),其權重是線上網路的指數移動平均。給定兩個擴增視角,線上網路看其中一個視角,試圖預測目標網路對另一視角的投影;損失是 L2 正規化向量間的均方誤差。關鍵在於:沒有梯度流入目標網路,其輸出是一個停止梯度(stop-gradient)的目標,並透過交換「哪個視角送往哪個網路」來把損失對稱化。
有兩項要素共同防止崩潰:線上端的預測器頭(使兩端不對稱,因而無法輕易彼此相等),以及緩慢移動的停止梯度目標(給線上網路一個穩定、落後的目標去追逐,而非一個它可能一起崩潰過去的移動標靶)。常數輸出在技術上確實是損失的一個不動點,但因為預測器加上 EMA 使動態系統偏離它,所以不會被達到。早期研究懷疑批次正規化(batch normalization)暗中提供了跨批次的隱式對比;後續研究顯示 BYOL 在採用與批次無關的正規化時仍然有效,證實預測器與目標的不對稱才是真正的反崩潰機制。
又称