多模態大型語言模型
影像詞元(image tokens)
語言模型以詞元(token)思考——一個接一個讀進的小塊。要讓它看見,影像得切成一條可比擬的序列。圖片被切成一格格小方塊,比方每塊 14×14 像素,每一塊變成一個向量——一個影像詞元(image token)。一張照片可能變成幾百個這種詞元,像句子一樣排好,讓模型和你的文字一起讀。
每塊被攤平後送進視覺編碼器,產生一個特徵向量;投影器再把它映射到模型的嵌入空間,使它緊鄰著詞向量。還會加上位置資訊,讓模型知道哪一塊原本在哪裡。從 Transformer 的角度看,這些只是序列裡多出來的項目——它對它們做注意力的方式,和對文字一模一樣。
影像詞元很貴。高解析度影像可能膨脹成上千個詞元,吃掉脈絡又拖慢推理,因此系統會縮小、切塊或池化區塊來壓低數量——拿視覺細節換速度。
又稱
另見