自監督與表徵學習
擴增不變性
擴增不變性是指:當你對輸入施加一個保留標籤的變換時,表徵幾乎不改變。在聯合嵌入式的自監督學習中,這不是副作用,而是整個訓練目標:藉由強迫同一張影像兩個不同擴增視角產生近乎相同的嵌入,你就是在明確地教編碼器忽略擴增所改變的一切。編碼器學到的是:這些差異無關緊要,所以別把它們編碼進去。
這使得擴增的選擇成為整個方法中最重要的歸納偏置(inductive bias),你等於在指定「特徵應該對什麼視而不見」。隨機縮放裁切教會對尺度與位置的不變性,是製造大部分難度的主力。色彩抖動教模型不要依賴精確的顏色與色相。高斯模糊降低對細微紋理的依賴。水平翻轉教會左右不變性。於是特徵編碼的是「在所有這些變換下仍倖存的東西」,也就是穩定的物件身份,同時丟棄被它們擾動的部分。
另一面是:當你摧毀的那個性質在下游其實重要時,不變性可能有害。強力的色彩擴增會建立色彩不變的特徵,這對物件分類很好,但對「花卉種類辨識」這類以顏色為訊號的任務卻很糟;裁切不變性可能抹去偵測中定位所需的空間資訊。這股張力驅動了當前對等變性(equivariance,表徵隨輸入以已知、可預測的方式變換,而非保持常數)以及任務感知擴增策略的研究,因為單一固定的不變性,不可能同時對每個下游任務都是最佳的。
因為擴增把你的假設編碼進去,對比模型的好壞取決於它的擴增配方。「移除色彩抖動會毀掉 SimCLR」這個著名結果,實質上是在說:少了它,同一張影像的兩個裁切只要靠色彩直方圖就能輕鬆配對,模型便永遠不必學到任何語義性的東西。
又称