表徵與自監督學習

DINO(無標籤自蒸餾)

DINO 顯示自監督的視覺轉換器學到了近乎詭異的東西:一個完全沒有標籤訓練出來的網路,其注意力圖會乾淨地亮在物體邊界上,免費產生可用的分割。其名是「無標籤自蒸餾」的縮寫,腦中該抓住的畫面是:一個學生網路試著去匹配一個老師的軟性輸出分布,而這位老師其實只是它自己緩慢演化的版本。

學生與老師共用架構;老師的權重是學生權重的指數移動平均。兩者都透過 softmax 把一個影像視圖轉成一個在大量原型維度上的機率分布。學生看小的局部裁切與大的全域裁切,老師只看全域裁切,學生被訓練以交叉熵去匹配老師的分布。兩個操作穩定老師並防止崩潰:置中(centering)減去老師輸出的滾動平均(阻止某一維度獨大),銳化(sharpening)使用很低的老師溫度(阻止退化成均勻分布)。置中與銳化的相互作用,使輸出既不崩成常數、也不崩成單一尖峰。

DINOv2 以精選資料與工程把它擴大,產出通用視覺特徵,在許多任務上不必微調即能與弱監督特徵比肩。那個湧現性質——純自蒸餾竟跑出與類別無關的物體分割——正是大家引用的重點,因為它暗示這套表徵捕捉到了「物體性」,而不只是紋理統計。

\mathcal{L} = -\sum_x P_t(x)\log P_s(x),\quad P_t = \mathrm{softmax}\!\big((g_t - c)/\tau_t\big)

對置中且銳化後的老師分布 P_t 的交叉熵。

置中與銳化是互補的抗崩潰力:只置中會趨向均勻分布,只銳化會趨向 one-hot——兩者平衡時,恰好抵消這兩種失敗模式。

又稱
DINOself-distillation with no labels無標籤自蒸餾