一個配方,許多模態
前三篇的一切——把一個模態對齊到語言、把凍結編碼器橋接進 LLM、做指令微調——都不是像素專屬的。把視覺塔換成音訊或影片編碼器,架構幾乎不變。深層原因在於橋說的是token:一旦任何訊號被轉成一串嵌入,transformer 就不在乎它們來自區塊、頻譜影格、還是影片片段。這正是視覺語言模型的進展能如此迅速地遷移到聲音與動態的原因。
語音基礎模型
語音基礎模型是 CLIP 與 BERT 在音訊上的對應:用自監督目標、在大量無標註(或弱標註)音訊上訓練的大型編碼器。有些(如 wav2vec/HuBERT)遮蔽並預測波形的潛在單元;有些(如 Whisper)在從網路抓來的數十萬小時轉錄音訊上做弱監督訓練,得到單一模型,能跨數十種語言轉錄與翻譯,對噪音與口音都展現驚人的穩健性。
語音基礎模型透過對比學習:將上下文向量拉近真實的量化目標,並推離干擾項。
音訊語言模型
音訊語言模型比辨識走得更遠:它們把音訊當成一種要生成的語言,而不只是感知。關鍵推手是神經音訊編解碼器——一個向量量化 VAE,把波形壓成一小串離散的聲學 token。如此一來,語音合成就成了對那些碼做自迴歸的下一個 token 預測,和文字一模一樣。模型可以用三秒鐘的某個聲音作提示後以那個聲音繼續說話,或接收口語輸入、端到端地以口語輸出回覆。
神經音訊編解碼器將每個編碼器輸出量化到最近的碼本條目,把波形變成模型可以生成的離散標記。
文字生成影片
文字生成影片是影像生成再加上最難的額外約束:時間。一段可信的影片必須讓物件、身分與物理在各影格間保持一致,同時又遵循提示。主流做法把擴散模型延伸到時空——在混合空間軸與時間軸的注意力下,對一段壓縮的潛在影片去噪。現代系統在影片自編碼器建出的潛在空間上跑擴散 transformer,因此模型從不逐影格去噪原始像素。
一個擴散流程,從隨機雜訊去噪到清晰的生成影像。
任意對任意:一個能感知又能生成的模型
統一的雄心是任意對任意多模態模型:單一網路接收任意混合的文字、影像與音訊,並產出任意混合。最乾淨的表述把每一個模態都 token 化成一個共享的離散或連續詞彙,再用一個 transformer 跑全部——理解與生成就成了同一個下一個 token 問題。架構各異:有些純粹在離散 token 上自迴歸,有些把自迴歸骨幹耦合到一個擴散頭,用以渲染連續像素或音訊以求更高保真度。
標記化將輸入轉換為共享空間中的標記 id 和嵌入向量。
統一各模態讓一個老問題變得更尖銳。當單一空間必須同時容納像素、音素與文字時,第一篇的模態差距會變本加厲地回來,而平衡各模態、別讓某一個主宰訓練,是件精細的事。下一篇將正面迎戰這些張力:我們究竟要怎麼衡量一個多模態模型是不是真的夠好?