表徵與自監督學習
對比預測編碼(CPC)
CPC 是引入 InfoNCE 損失、並為序列上的預測式自監督(音訊、文字、時間排序的影像區塊)立下現代範本的工作。其前提是:對當下的好表徵應能讓你預測未來,但預測原始的未來訊號(下一個音訊波形取樣)是無望的,且被雜訊主導。於是 CPC 在一個學來的潛在空間中預測未來,並把預測框定為一個對比的選擇,而非迴歸。
一個編碼器把每個時間步映射成潛在向量,一個自迴歸模型(原本是 GRU)把過去的潛在向量摘要成一個脈絡向量。要預測未來 k 步,就用脈絡的一個學來的線性映射,去對真正的未來潛在向量與一組從資料他處取樣的負樣本評分,採用 InfoNCE 損失。預測未來數步而非只預測下一步,鼓勵脈絡去捕捉緩慢變化的高層結構(說話者的身分、句子的主題),而非快速的局部細節。
CPC 的持久影響是概念性的:它把自監督預測連結到互資訊最大化,並證明這套配方能跨模態移植。語音的 wav2vec 與許多序列表徵方法都直接承襲自它,而對比預測的想法也在 JEPA 的表徵空間預測中再度出現。
\mathcal{L}_k = -\,\mathbb{E}\!\left[\log\frac{\exp(z_{t+k}^\top W_k c_t)}{\sum_{z_j\in N}\exp(z_j^\top W_k c_t)}\right]
從脈絡 c_t 預測未來潛在向量 z_{t+k},並對抗負樣本集 N。
刻意預測多步:一步預測可由低層的連續性解決,而多步預測逼模型去編碼抽象、緩慢變化的內容。
又稱
另見