多模態大型語言模型

音訊大型語言模型(audio LLM)

音訊大型語言模型(audio LLM)聽得見。它不再只是、或不只是讀文字、看影像,而是把聲音當輸入——說出的話、音樂、嬰兒的哭聲、汽車引擎——並用語言推理。你可以放一段語音留言請它摘要、哼一段旋律問它是什麼曲子、或餵進一段會議錄音問誰說了什麼。它用的手法和視覺一樣:把訊號變成語言模型能讀的詞元。

波形先被轉成頻譜圖,或通過一個音訊編碼器,常是 Whisper 家族這類語音模型,產生一串特徵向量;投影器再把它們映射到模型的詞元空間。模型接著同時對聲音與文字做注意力。有些音訊模型還會回話,把語言模型配上語音合成器,讓整個迴圈——聽、想、開口答——一氣呵成。

時間是難處。音訊又長又密,模型只能大刀闊斧地壓縮,因而可能漏掉短暫的事件、重疊的說話者,或藏在語氣裡那種反諷與真心的差別。

又称
audio language modelaudio-language model