多模態與視覺語言
音訊語言模型
音訊語言模型對待聲音的方式,就像大型語言模型對待文字:把它當成一串要逐一預測的詞元。把語音、音樂或環境聲響轉成離散碼、再訓練一個 transformer 去接續這串序列,模型便能用驅動文字生成的同一套機制來生成或理解音訊——產出能保住說話者音色與韻律的語音、接續一段旋律,或在與文字耦合時遵循口說指令並出聲回答。
讓這成為可能的關鍵手法是神經式音訊詞元化。一個殘差向量量化編解碼器把波形壓縮成一疊離散詞元,供 transformer 自迴歸建模;許多系統會把捕捉內容與韻律的粗略「語意詞元」,與捕捉說話者身分與錄音細節的精細「聲學詞元」分開,分層生成。這些音訊詞元也越來越常被併入單一的多模態語言模型,使文字與語音共享一套詞彙與一套權重,造就能端到端聆聽與回覆的口語對話系統。
由於它們在詞元層級對音訊建模,這些模型能捕捉早期訊號處理流程錯失的長程結構,但也繼承了編解碼器的人工痕跡、在長時生成中可能漂移,並在語音複製方面引發尖銳的安全問題。隨著辨識、合成與對話匯流為單一系統,音訊語言模型與語音基礎模型之間的界線正逐漸模糊。
又称
另见