多模態大型語言模型

模態投影器(modality projector)

投影器(projector)是讓眼睛和語言大腦對話的小小轉接頭。視覺編碼器說的是自己的特徵向量,跟大型語言模型期待的詞嵌入並不天生對齊。投影器負責翻譯:它把每個影像特徵重塑成一個落在模型詞元空間裡的向量,讓模型讀它時,就像讀一個它懂的詞。

最簡單的形式只是幾層線性層、一個 MLP——和巨大的編碼器與語言模型相比只是寥寥幾個參數。更講究的設計用一小組學到的查詢向量去對影像做注意力,把它壓縮成固定數量的詞元,即重採樣器或 Q-Former 的構想,藉此控制成本。訓練時編碼器與語言模型常被凍結,只讓投影器學習——這是替既有模型裝上眼睛的便宜辦法。

正因為這座細橋承載這麼多,它也是瓶頸:差勁的投影器會浪費一個優秀的編碼器,而它強加的固定詞元預算,限定了究竟有多少視覺細節能抵達語言模型。

又称
multimodal connectoradapterresampler