同樣的訣竅,新的感官
你為影像學到的一切,都直接搬得過來。想要聽覺?把視覺編碼器換成一個音訊編碼器,把聲音波形轉成一串特徵向量,透過投影器把它們投影成詞元形狀的向量,拼進序列,再跑同一個多模態模型。這套配方——編碼、投影、拼接——與模態無關。只有前端的編碼器會變。
一個 Transformer 區塊,包含層正規化、自注意力、殘差連接與前饋網路。
聽覺:音訊大型語言模型與語音轉文字
音訊大型語言模型(audio LLM)直接把聲音當輸入。這涵蓋很廣:轉錄語音,也包括描述非語音的聲響(「雨聲中有狗在叫」)、回答關於一段錄音的問題(「這段是什麼曲風?」),或分析語氣與情緒。聲音是以頻譜圖(spectrogram)或學到的音訊特徵、而非原始取樣的形式餵進去的,但概念上,它就只是另一串供模型關注的詞元。
語音轉文字(speech-to-text)是最常見的音訊任務,值得單獨點出。經典的轉錄系統只輸出文字;以大型語言模型為基礎的系統則是轉錄兼理解,所以一趟下來就能轉錄一場會議、標出可能是誰說了什麼,並交給你一份附帶待辦事項的摘要。接地仍然重要——摘要該反映實際說過的話,而不是一場聽起來合理的會議。
觀看:影片理解
影片理解(video understanding)是最豐富的感官,因為它多了時間。標準做法簡單到近乎難為情:從影片中取樣畫格(frame,例如每秒一到兩張),用視覺編碼器把每一格當成影像來編碼,再把所有畫格詞元按時間順序鋪進序列裡——有時還和音軌的詞元交錯排列。模型接著就跨畫格推理:「摘要這段影片」、「講者在什麼時候提到價格?」、「那個人是在坐下之前還是之後拿起杯子的?」
把位置編碼向量加到嵌入向量上,用以標記序列順序。
新的稅金:時間很貴
動態正是成本爆炸之處。一張影像可能是數百個詞元;以每秒兩格取樣的一分鐘影片就是 120 張影像——數萬個詞元——而音訊還會在上頭再加一串自己的。這直接撞上脈絡長度限制:視窗裝得下的就那麼多,而注意力成本又隨序列長度增長。因此,長影片理解既是一個建模問題,也同等是一個工程問題(聰明地挑畫格、壓縮詞元、高效的多模態詞元化)。
動態為何是新增的開銷:詞元數量隨時長×影格率×每影格詞元數增長,而音訊還要疊加自己的一路資料流。
- 音訊大型語言模型:聽得見聲音——能轉錄、描述並推理錄音內容。
- 語音轉文字:一趟內完成轉錄與理解(分辨說話者、摘要、擷取)。
- 影片理解 = 隨時間排列的影像:取樣畫格、編碼、排序、推理。
- 盯緊額度:時間意味著大量詞元——刻意選好你的取樣率。