自監督與表徵學習
SimSiam
SimSiam 是 BYOL 精簡化的手足,它探問:非對比方法可以簡到什麼程度,卻仍能避免崩潰。它是一個孿生網路(Siamese network),兩個分支共享同一個編碼器,餵入一張影像的兩個擴增視角,訓練成讓兩個輸出彼此一致。沒有負樣本對、沒有大批次、沒有記憶佇列,而且關鍵在於完全沒有動量編碼器。整個反崩潰機制只歸結為一個操作:停止梯度(stop-gradient)。
細節上,兩個視角都通過同一個編碼器與投影器。其中一個分支額外通過一個小型預測器頭,其輸出(以負餘弦相似度)去匹配另一分支的投影。另一分支的投影被施加停止梯度,意即把它當作固定目標,不讓梯度回流。損失被對稱化,使每個視角都扮演兩種角色。這就是整個方法,而核心的實驗發現是:移除停止梯度會立刻導致徹底崩潰成常數,保留它則產生很強的表徵。
SimSiam 的貢獻在於概念上的清晰:它把停止梯度孤立出來,指認其為關鍵成分,並顯示 BYOL 的動量編碼器與 SimCLR 的負樣本雖有幫助,但並非防止崩潰所嚴格必需。作者提出一種詮釋,把它看作交替最佳化(類似期望最大化,EM)的程序,其中停止梯度對應於「固定一組變數、更新另一組」,這也說明了為何少了它、同時最佳化兩端就會退化。它至今仍是理解「非對比自監督為何能成立」的熱門參照點。
又稱