自監督與表徵學習

前置任務

前置任務是你刻意發明的一個假問題,目的純粹是讓「解這個任務」迫使網路學到好的特徵。pretext 一詞字面意思就是「藉口」:根本沒人真的在乎這個任務的答案,答案只是逼網路仔細端詳影像的藉口。賭注在於:若不曾理解物件、部件、幾何或顏色,你就無法把前置任務解得好,因此沿途習得的特徵能遷移到你真正在乎的任務。

經典的影像前置任務包括:預測影像被施加了四種 90 度旋轉中的哪一種(RotNet),模型因此必須知道物件「正立」的標準姿態;藉由預測被打亂區塊的排列順序來解拼圖(jigsaw),這迫使模型理解物件部件的佈局;上色(colorization),即預測灰階影像的顏色,需要模型認得草是綠的、天是藍的;以及修補(inpainting),補回被挖掉的區域,這要求對情境進行建模。每個任務都從未標註影像自動構造出自己的標籤。

手工設計前置任務的深層侷限是:特徵可能變得過度貼合前置任務本身,學到一些不靠真正理解就能解題的捷徑。例如拼圖求解器可以靠匹配區塊邊界的色差或邊緣連續性來作弊,而非真的辨識物件。這個「捷徑問題」正是此領域大致從手工前置任務轉向以不變性為基礎的目標(對比與分群方法)與遮罩重建的主因,後者提供了更難作弊、更通用的學習訊號。

RotNet 前置任務:取一張站立狗的照片,旋轉 0、90、180 或 270 度,要網路分類出旋轉角度。網路唯有學會狗的頭、腿與地面通常的位置才能答對,於是在零標籤下習得了有用的物件特徵。

又稱
proxy taskauxiliary task