表徵與自監督學習

BYOL(自舉潛在表徵)

BYOL 帶來一個震撼業界的驚奇:完全不用負樣本對也能學到強表徵。直覺上,若你只把同一影像的兩個視圖拉近、卻從不把任何東西推開,最明顯的捷徑就是把每個輸入都映射成同一個常數向量——也就是崩潰。BYOL 在不使用顯式負樣本的情況下避開了這種崩潰,這起初看來幾乎自相矛盾。

它用兩個網路。線上網路(編碼器、投影器,外加一個預測器)被訓練成:從一個增強視圖去預測目標網路對另一視圖所產生的投影。目標網路是線上網路的動量副本——其權重為指數移動平均,並以停止梯度阻斷任何梯度流入。損失就只是「L2 正規化後的線上預測」與「目標投影」之間的均方誤差。因為目標移動緩慢且從不由梯度更新,它就像一個穩定、漸進改善的老師,讓線上網路自我自舉。

它為何不崩潰,較為微妙,事後被仔細研究:預測器、停止梯度與動量目標三者合在一起,打破了原本會允許常數解的對稱性;投影器中的批次正規化後來也被發現有所貢獻。BYOL 之所以重要,在於它移除了對大型負樣本庫的依賴,並啟發了 DINO 與一整條免負樣本方法的路線。

\mathcal{L} = \Big\lVert \overline{q(z_\theta)} - \overline{z'_\xi} \Big\rVert_2^2,\quad \xi \leftarrow \tau\xi + (1-\tau)\theta

預測器輸出對停止梯度的目標;\xi 為 EMA 目標權重。

拿掉預測器或停止梯度任一者,BYOL 都會崩潰——它們不是可有可無的正則化,而是阻止平凡常數解的核心機制。

又称
BYOLbootstrap your own latent自舉潛在表徵