多模態與視覺語言
視覺編碼器與投影模組
在最流行的 VLM 配方裡,系統的兩半由一道刻意保持簡單的接縫相連。視覺編碼器(幾乎總是一個預訓練好的視覺 transformer)把影像轉成一格格的補丁嵌入;接著投影模組把每個嵌入映射進語言模型的詞嵌入空間,於是影像以一串「偽詞元」的形式抵達,語言模型便能把它們與真正的文字詞元並排關注。投影模組就是那位讓圖片說起語言模型方言的翻譯。
LLaVA 展示了這個投影模組可以樸素到只是一個兩層的多層感知器,與精巧的 Q-Former 或閘控跨注意力形成鮮明對比。每個補丁特徵都通過同一個小網路,所得詞元就直接串接進提示,語言模型透過它本來的自注意力處理融合。訓練先在說明文字資料上只對齊投影模組(兩個骨幹凍結),再解凍語言模型做指令微調,影像詞元數量隨輸入解析度而增加。
「投影加串接」這條路,用跨注意力的參數效率換取了簡潔與高解析度的保真度,因為每個補丁都成了語言模型能直接讀的詞元。其代價是序列長度:高解析度或多影像輸入可能用數千個視覺詞元淹沒脈絡,這正是詞元合併與自適應解析度方案變得重要的原因。
又稱
另見