自監督與表徵學習

正負樣本對

每一種對比方法都建立在一個設計決定之上:哪些樣本算正樣本(該相似)、哪些算負樣本(該不同)。在自監督的實例判別中,規則是機械式的,正樣本對是同一來源影像的兩個擴增視角,負樣本則是所有其他影像的視角。在監督式對比學習中,定義更豐富,所有共享同一類別標籤的影像彼此互為正樣本。這條規則的選擇,悄悄決定了表徵會把什麼視為相同、把什麼分開。

負樣本承載了大部分難度,也帶來大部分槓桿。容易的負樣本(貓對上毫不相干的天空)很快就被滿足,一旦分開幾乎不再貢獻梯度。難負樣本(貓對上長得很像的狗,或視覺上相似場景的另一個裁切)在嵌入空間中靠得很近,產生大而富資訊的梯度,真正銳化了邊界。因此各方法都重視負樣本挖掘(negative mining),刻意把難負樣本浮現出來或加重其權重,也重視單純「擁有大量負樣本」,因為候選越多,其中含有難負樣本的機率越高。

危險的失效模式是假負樣本(false negative):一個被標為負樣本、實際上在語義上與查詢完全相同的樣本,例如在實例判別下,同一犬種的兩張不同照片被當成負樣本。此時損失會主動把本該相聚的東西推開,注入雜訊。這個假負樣本問題,是非對比家族(BYOL、SimSiam、SwAV、DINO,完全避開顯式負樣本)以及「先把可能相似的影像分群再對比」的分群法最有力的動機之一。

又称
positives and negativespair sampling