自監督與表徵學習
表徵學習
表徵學習研究的是如何把像素這類原始、高維的輸入,轉換成一個精簡的數字向量(也就是嵌入,embedding),讓它捕捉到有意義的內容,而非表面的雜訊。其目標不是回答某一個特定問題,而是產生對許多尚未被問到的問題都有用的特徵。好的表徵會把世界中容易分辨的結構顯式化:在一個好的嵌入空間裡,兩張貓的照片彼此靠近、遠離卡車的照片,於是連最簡單的分類器都能把它們分開。
評判表徵好壞所依據的目標,通常以一組理想性質來陳述:線性可分性(類別能被簡單的線性邊界分開)、可遷移性(同一組凍結特徵能在新資料集與新任務如偵測、分割上派上用場)、穩健性(對輸入做無關緊要的小改動,嵌入幾乎不動),有時還包括解耦(disentanglement,不同座標捕捉姿態、顏色、身份等不同變異因子)。這些正是我們偏好學習而得的特徵、勝過 SIFT 或 HOG 等手工特徵的深層理由。
讓表徵學習成為一門科學而非一種感覺的,是它的評估方式。標準的探測法有:在凍結特徵上訓練單一線性層(線性評估協定);直接在嵌入空間做 k 近鄰分類;在小型標註集上對整個網路微調;或整個遷移到另一個下游任務。關鍵在於,沒有任何單一數字能道盡全貌,一個方法可能線性探測平平、微調卻表現傑出(這正是 MAE 對比 SimCLR 的差異),因此實務上會在多個資料集上回報多項指標。
又称