自監督與表徵學習
對比學習
對比學習透過「比較」來塑造嵌入空間:該相似的東西被拉近,該不同的東西被推遠。在最常見的自監督版本,也就是實例判別(instance discrimination)中,每一張影像都被當作自己獨有的一個類別。你對同一張影像做兩份隨機擴增的副本(例如隨機裁切加上色彩抖動),宣告它們是必須落得彼此靠近的正樣本對;而批次中其他每一張影像都是必須被推開的負樣本。
從幾何上看,編碼器把每個視角映射成一個點,這些點通常經過 L2 正規化,因此落在單位超球面上;損失同時提升對齊性(正樣本靠近)與均勻性(整組點均勻散佈於球面)。把負樣本推開是關鍵成分:若沒有這股排斥力,要讓正樣本一致最省事的辦法就是把每張影像都映射到同一個常數點,這是崩潰而無用的解。負樣本提供了讓空間不致崩潰的力量。
主流損失是 InfoNCE,它把比較構造成一個分類問題:在一個正樣本與許多負樣本之中,指認出哪一個才是真正的配對。由於訊號品質隨負樣本數量增加而提升,兩個著名框架的主要差別就在於如何便宜地供應大量負樣本:SimCLR 使用非常大的批次,負樣本就是同一批次中的其他影像;MoCo 則維護一個記憶佇列,存放由緩慢移動的動量編碼器所產生、近期看過的嵌入。對比方法產生的特徵具有很強的線性可分性,正是首度在 ImageNet 上追平監督式預訓練的突破。
又称