自監督與表徵學習
DINO
DINO(self-DIstillation with NO labels,無標籤自我蒸餾)把自監督構造成「學生模仿老師」,而兩者是同一個網路、且完全沒有任何標籤。一個學生網路被訓練去匹配教師網路在同一張影像不同擴增視角上的輸出分布。教師並非另一個預訓練好的模型;它是學生自身的指數移動平均,因此學生實際上是在從自己緩慢更新的過去版本中蒸餾知識。完全沒有負樣本,也完全沒有對比比較。
兩個網路最後都接一個 softmax,產生對 K 個輸出維度的機率分布(一種柔性的群分配,不過這些維度沒有預先定義的意義)。教師被餵入全域裁切,學生則被餵入包含小型局部裁切在內的所有裁切(即 SwAV 的多裁切策略),學生以交叉熵被訓練去重現教師的分布。崩潰透過施加於教師的一對平衡操作來防止:中心化(centering,減去一個滾動均值,使任一輸出維度都無法獨大)與銳化(sharpening,使用較低的 softmax 溫度,使分布不致攤平成均勻)。中心化與銳化方向相反,兩者合力維持輸出分布的健康。
DINO 最受讚譽的發現是視覺轉換器中的湧現行為:[CLS] 標記的自注意力圖會自發地凸顯物件邊界,產生可用的非監督分割;而凍結特徵在不做任何微調下就能給出異常強的 k 近鄰分類。這暗示自監督與 ViT 架構特別契合。後續的 DINOv2 以經過策劃的大規模資料與工程改良擴展了這套配方,產出無需微調即可跨多種任務遷移的通用視覺特徵。
又稱