JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

超越像素:音訊、語音與影片

同一套編碼器與拼接的訣竅,給了模型耳朵和時間感——以及動態帶來的新成本。

同樣的訣竅,新的感官

你為影像學到的一切,都直接搬得過來。想要聽覺?把視覺編碼器換成一個音訊編碼器,把聲音波形轉成一串特徵向量,透過投影器把它們投影成詞元形狀的向量,拼進序列,再跑同一個多模態模型。這套配方——編碼、投影、拼接——與模態無關。只有前端的編碼器會變。

无论是哪种感官,处理这条共享词元序列的都是同一个 Transformer 模块——归一化、注意力、残差、前馈网络。

一个 Transformer 模块,包含层归一化、自注意力、残差连接和前馈网络。

聽覺:音訊大型語言模型與語音轉文字

音訊大型語言模型(audio LLM)直接把聲音當輸入。這涵蓋很廣:轉錄語音,也包括描述非語音的聲響(「雨聲中有狗在叫」)、回答關於一段錄音的問題(「這段是什麼曲風?」),或分析語氣與情緒。聲音是以頻譜圖(spectrogram)或學到的音訊特徵、而非原始取樣的形式餵進去的,但概念上,它就只是另一串供模型關注的詞元。

語音轉文字(speech-to-text)是最常見的音訊任務,值得單獨點出。經典的轉錄系統只輸出文字;以大型語言模型為基礎的系統則是轉錄理解,所以一趟下來就能轉錄一場會議、標出可能是誰說了什麼,並交給你一份附帶待辦事項的摘要。接地仍然重要——摘要該反映實際說過的話,而不是一場聽起來合理的會議。

觀看:影片理解

影片理解(video understanding)是最豐富的感官,因為它多了時間。標準做法簡單到近乎難為情:從影片中取樣畫格(frame,例如每秒一到兩張),用視覺編碼器把每一格當成影像來編碼,再把所有畫格詞元按時間順序鋪進序列裡——有時還和音軌的詞元交錯排列。模型接著就跨畫格推理:「摘要這段影片」、「講者在什麼時候提到價格?」、「那個人是在坐下之前還是之後拿起杯子的?」

按时间采样的帧会被加上位置编码,让模型知道它们的先后顺序——这正是“加入时间”的含义。

把位置编码向量加到嵌入向量上,用以标记序列顺序。

新的稅金:時間很貴

動態正是成本爆炸之處。一張影像可能是數百個詞元;以每秒兩格取樣的一分鐘影片就是 120 張影像——數萬個詞元——而音訊還會在上頭再加一串自己的。這直接撞上脈絡長度限制:視窗裝得下的就那麼多,而注意力成本又隨序列長度增長。因此,長影片理解既是一個建模問題,也同等是一個工程問題(聰明地挑畫格、壓縮詞元、高效的多模態詞元化)。

N_{\text{tokens}} \;\approx\; \underbrace{T \cdot f}_{\text{frames}}\, t_{\text{frame}} \;+\; T \cdot t_{\text{audio}}

运动为何是新增的开销:词元数量随时长×帧率×每帧词元数增长,而音频还要叠加自己的一路数据流。

  1. 音訊大型語言模型:聽得見聲音——能轉錄、描述並推理錄音內容。
  2. 語音轉文字:一趟內完成轉錄與理解(分辨說話者、摘要、擷取)。
  3. 影片理解 = 隨時間排列的影像:取樣畫格、編碼、排序、推理。
  4. 盯緊額度:時間意味著大量詞元——刻意選好你的取樣率。