表徵與自監督學習

SwAV(視圖間交換指派)

SwAV 把對比學習與線上分群融合,藉此繞開「直接比較每一對影像」的需求。它問的不是「這兩個嵌入是否相同」,而是「同一影像的兩個視圖是否被指派到同一群」。一組可學習的原型向量扮演群心的角色,監督訊號就是:從一個視圖算出的群碼,應能從另一視圖被預測出來。

對每個批次,它先把嵌入與原型匹配,算出軟性的群指派(群碼),再施加交換預測損失:用視圖 B 的特徵預測視圖 A 的群碼、反之亦然,透過對原型的交叉熵。危險在於把所有影像都丟進同一群的平凡解,因此 SwAV 用 Sinkhorn-Knopp 演算法線上計算群碼,它求解一個帶熵正則化的最優傳輸問題,約束批次內各原型的指派要均等分配。正是這個平衡約束阻止了群崩潰。

SwAV 還引入了多裁切(multi-crop):在兩張全解析度裁切之外,再餵入數張低解析度裁切,廉價地增加視圖數量並明顯改善特徵。由於它對比的是群碼而非實例特徵,它既不需要大型負樣本庫、也不需要記憶佇列,這在它問世當時相當高效。

\mathcal{L} = \ell(z_t, q_s) + \ell(z_s, q_t),\quad \ell(z,q)=-\sum_k q^{(k)}\log \mathrm{softmax}(z^\top c_k)

交換預測:用一視圖的特徵 z 去預測另一視圖的群碼 q。

Sinkhorn 的平衡正是抗崩潰機制——拿掉均等分配約束,模型就能任意把一切指派到單一原型。

又称
SwAVswapping assignments between viewsonline clusteringSinkhorn