表徵與自監督學習

線性探測評估

線性探測是衡量「一個學來的表徵本身有多好」的標準量尺。你凍結預訓練骨幹使其權重不可變,取它產生的特徵,只在其上訓練單一線性層(一個邏輯迴歸)去預測標籤。那個薄分類器的準確率,是個代理指標,反映凍結後的特徵在任何特定任務適應之前,已有多麼線性可分、多麼即取即用。

凍結這項紀律正是重點所在。若你微調了骨幹,最終的高準確率可能來自骨幹在微調中自我重塑,而非來自預訓練特徵的品質,這會混淆你想量測的對象。只允許一個線性頭,這套協定便把表徵隔離出來:好的自監督方法應把語意相似的輸入放進線性可分的區域,因此一條簡單的邊界就夠。它便宜、可重現、且能跨方法比較,這正是幾乎每篇 SSL 論文都會回報它的原因。

它的限制值得點明。線性探測準確率與微調準確率可能把方法排出不同名次——例如 MAE 探測表現平平,微調卻極佳,因為它的特徵豐富但不是線性組織的。探測也偏好那些恰好對齊探測資料集類別的特徵,並可能漏掉某些對偵測或分割重要的性質(例如局部空間結構)。

線性探測分數低並不代表骨幹差——MAE 是經典反例:探測低估了一個微調後能登頂的表徵。

又稱
linear probe線性探測linear evaluation protocol