表徵與自監督學習

聯合嵌入預測架構(JEPA)

JEPA 是一套設計哲學,被倡議為通往更像世界模型之學習的路徑,主張:不要預測原始訊號,而要預測它的表徵。一個逐像素重建的生成模型,會把容量浪費在建模不可預測的細節上,例如確切的紋理與雜訊。JEPA 改而要求網路:從可見部分的嵌入去預測輸入缺失部分的抽象嵌入,如此便能忽略那些不帶有用結構的細節。

在影像版本 I-JEPA 中,一個脈絡編碼器嵌入一組可見區塊,一個目標編碼器(動量副本)嵌入數個被遮罩的目標區塊,而一個預測器接收脈絡嵌入加上某目標區塊的位置資訊,去預測該區塊的目標嵌入,損失在特徵空間而非像素空間衡量。如同 BYOL 與 DINO,目標編碼器以指數移動平均加停止梯度更新,這正是阻止系統崩成常數的關鍵。取樣相當大、且具語意意義的目標區塊(而非散落的像素),對學到好的抽象很重要。

其動機在於:在表徵空間中預測,天生對干擾性變異不變,且避開了 MAE 式模型所付的像素重建稅,同時保有自蒸餾的強特徵品質。JEPA 可由影像推廣到影片與其他模態,並被定位為預測式世界模型的構件。

JEPA 不是單一模型而是一個範本;它與 MAE 的差別純粹在於損失衡量的地方——嵌入空間還是像素空間。

又稱
JEPAI-JEPAjoint-embedding predictive architecture聯合嵌入預測架構