JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

超越影像:音訊、語音、影片與任意對任意

同樣的「對齊加橋接」配方能推廣到波形與影格。語音、音訊與影片如何接進語言模型,以及「任意對任意」到底是什麼意思。

一個配方,許多模態

前三篇的一切——把一個模態對齊到語言、把凍結編碼器橋接進 LLM、做指令微調——都不是像素專屬的。把視覺塔換成音訊或影片編碼器,架構幾乎不變。深層原因在於橋說的是token:一旦任何訊號被轉成一串嵌入,transformer 就不在乎它們來自區塊、頻譜影格、還是影片片段。這正是視覺語言模型的進展能如此迅速地遷移到聲音與動態的原因。

語音基礎模型

語音基礎模型是 CLIP 與 BERT 在音訊上的對應:用自監督目標、在大量無標註(或弱標註)音訊上訓練的大型編碼器。有些(如 wav2vec/HuBERT)遮蔽並預測波形的潛在單元;有些(如 Whisper)在從網路抓來的數十萬小時轉錄音訊上做弱監督訓練,得到單一模型,能跨數十種語言轉錄與翻譯,對噪音與口音都展現驚人的穩健性。

\mathcal{L}=-\log\frac{\exp\!\big(\mathrm{sim}(c_t,q_t)/\tau\big)}{\sum_{\tilde q\in Q_t}\exp\!\big(\mathrm{sim}(c_t,\tilde q)/\tau\big)}

語音基礎模型透過對比學習:將上下文向量拉近真實的量化目標,並推離干擾項。

音訊語言模型

音訊語言模型比辨識走得更遠:它們把音訊當成一種要生成的語言,而不只是感知。關鍵推手是神經音訊編解碼器——一個向量量化 VAE,把波形壓成一小串離散的聲學 token。如此一來,語音合成就成了對那些碼做自迴歸的下一個 token 預測,和文字一模一樣。模型可以用三秒鐘的某個聲音作提示後以那個聲音繼續說話,或接收口語輸入、端到端地以口語輸出回覆。

\mathbf{z}_q=\mathbf{e}_{k},\qquad k=\arg\min_{j}\;\lVert\mathbf{z}_e(x)-\mathbf{e}_j\rVert_2

神經音訊編解碼器將每個編碼器輸出量化到最近的碼本條目,把波形變成模型可以生成的離散標記。

文字生成影片

文字生成影片是影像生成再加上最難的額外約束:時間。一段可信的影片必須讓物件、身分與物理在各影格間保持一致,同時又遵循提示。主流做法把擴散模型延伸到時空——在混合空間軸與時間軸的注意力下,對一段壓縮的潛在影片去噪。現代系統在影片自編碼器建出的潛在空間上跑擴散 transformer,因此模型從不逐影格去噪原始像素。

文字生成影片是帶有時間軸的影像擴散:從純雜訊去噪,生成必須在時間上保持連貫的影格。

一個擴散流程,從隨機雜訊去噪到清晰的生成影像。

任意對任意:一個能感知又能生成的模型

統一的雄心是任意對任意多模態模型:單一網路接收任意混合的文字、影像與音訊,並產出任意混合。最乾淨的表述把每一個模態都 token 化成一個共享的離散或連續詞彙,再用一個 transformer 跑全部——理解與生成就成了同一個下一個 token 問題。架構各異:有些純粹在離散 token 上自迴歸,有些把自迴歸骨幹耦合到一個擴散,用以渲染連續像素或音訊以求更高保真度。

任意到任意的方案:將每種模態都標記化為同一個共享序列,使單一模型可以讀取並生成任意組合。

標記化將輸入轉換為共享空間中的標記 id 和嵌入向量。

統一各模態讓一個老問題變得更尖銳。當單一空間必須同時容納像素、音素與文字時,第一篇的模態差距會變本加厲地回來,而平衡各模態、別讓某一個主宰訓練,是件精細的事。下一篇將正面迎戰這些張力:我們究竟要怎麼衡量一個多模態模型是不是真的夠好?