JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

遮罩與預測式建模:MAE、VQ-VAE、JEPA

從重建像素到在表徵空間中預測——以及關於自監督模型究竟該預測什麼的現場辯論。

通往表徵的生成式路線

前三篇指南都在比較視角。還有一個更古老、同樣強大的想法:把輸入的一部分藏起來,訓練模型把它補回去。在語言中這就是遮罩語言建模(masked language modeling)——BERT 背後的引擎——你遮住一些 token,再從上下文預測它們。視覺領域的自然問題是:同樣的去噪自編碼器(autoencoder)配方,能不能在影像上與對比方法分庭抗禮?經過幾次失敗的起步後,答案是響亮的「能」。

遮罩自編碼器(MAE)

遮罩自編碼器(masked autoencoders, MAE)用兩個設計決策,讓遮罩影像建模既有效又高效。第一,激進的遮罩比例——遮住 75% 的影像區塊,遠高於語言的 15%,因為影像在空間上高度冗餘,太簡單的任務什麼也教不了。第二,不對稱的編碼器-解碼器:笨重的 ViT 編碼器只看那約 25% 可見的區塊(省下巨量計算),再由一個輕量解碼器,從編碼器輸出加上遮罩 token 重建缺失的像素。預訓練完成後,丟掉解碼器、保留編碼器。

\mathcal{L}_{\mathrm{MAE}} = \frac{1}{|\mathcal{M}|}\sum_{i\in\mathcal{M}} \big\lVert \hat{x}_i - x_i \big\rVert_2^2

MAE 的目标:仅在被掩码的图块集合 M 上计算的像素重建损失。

離散目標:VQ-VAE 與 token 化預測

重建原始像素,會把容量花在難以察覺的高頻細節上。一個離散的替代方案是預測 tokenVQ-VAE(向量量化 VAE)學出一個有限的碼本(codebook),把每個影像區塊映射到最近的碼本條目,將連續影像變成一格格離散 token——正是語言模型式目標所需的基底。遮罩 token 預測(預測缺失的碼本索引而非原始像素)往往給出更乾淨的目標,也是許多影像與多模態生成器的底層。

VQ-VAE 保留编码器→潜空间→解码器的自编码器结构,但用离散码本对潜变量进行量化。

自编码器示意图:编码器将输入映射为潜向量,解码器再重建输入。

z_e = encoder(x)                       # continuous patch features
idx = nearest_codebook_index(z_e, C)   # quantize to discrete tokens
z_q = C[idx]                           # straight-through estimator
x_hat = decoder(z_q)                   # reconstruct from codes
VQ-VAE:學到的碼本把連續區塊變成離散、可預測的 token。

在表徵空間中預測:JEPA

重建像素迫使模型對一切建模,包括不可預測的細節(草地的確切紋理)。聯合嵌入預測架構(Joint-Embedding Predictive Architecture, JEPA)主張:你應該改去預測被遮罩區域的表徵,而非它的像素。一個編碼器嵌入可見的上下文;一個預測器去猜一個(動量)目標編碼器會指派給隱藏區域的嵌入;損失完全活在特徵空間裡。這抽象掉了像素層級的雜訊,呼應了 CPC 的「預測潛在表徵」哲學——卻不靠負樣本,而是用與 BYOL 相同的停止梯度動量目標。

\mathcal{L}_{\mathrm{JEPA}} = \big\lVert\, g_\phi\!\big(E_\theta(x)\big) - \operatorname{sg}\!\big(E_{\bar{\theta}}(y)\big) \big\rVert_2^2

JEPA 从上下文预测目标的嵌入,在表示空间中匹配;停止梯度的目标编码器避免表示坍缩。

像素還是特徵:你該預測什麼?

這是這個領域現場的張力。重建像素(MAE)簡單、穩定,並給出有用的生成先驗,卻把容量浪費在雜訊上、線性可分性較弱。預測離散 token(VQ-VAE 式)清理了目標,卻繼承了碼本的偏差與棘手的量化步驟。在潛在空間中預測(JEPA)最具資料效率也最抽象,但重新引入了像素重建本來免疫的崩塌風險——你又回到需要停止梯度與動量目標,來讓潛在目標保持誠實。

前沿與開放問題

這會走向何方?三個誠實的開放問題。(1)統一——對比、蒸餾、冗餘消除與遮罩方法全都在對抗崩塌、全都在最大化一個散得開且對視角不變的表徵;一個能涵蓋它們的單一理論仍在浮現中。(2)超越影像——影片、語音與具身資料有著靜態影像增強所忽略的時間與因果結構,那裡最好的前置任務尚無定論。(3)評估的誠實——線性探測方便,卻可能誤導;社群一再發現,「最佳」的 SSL 方法高度取決於下游任務、架構與計算預算。