多模態大型語言模型
多模態詞元化(multimodal tokenization)
詞元化(tokenization)是把任何輸入切成 Transformer 能讀的離散單位的方式。對文字,它把句子切成子詞片段。多模態詞元化(multimodal tokenization)把同樣的想法延伸到其他一切:你要怎麼把影像、聲音或影片,切成一條乾淨、可供模型吞食的詞元序列?把這件事做對,是每一個多模態模型賴以運轉的樞紐。
大致有兩種風格。連續式詞元化把每個影像區塊或音訊影格保留為編碼器輸出的實數值特徵向量,投影到詞嵌入旁邊——靈活,也是理解類任務的標準作法。離散式詞元化則把訊號量化成固定碼本裡的條目,用 VQ 自編碼器這類學到的詞元化器,於是一張圖真的變成一串整數詞元,就像文字一樣——這正是讓一個模型能用共享機制跨模態地讀與生成的關鍵。
每種方案都拿細節換詞元數。詞元太少,精細資訊就流失;太多,單一張影像就淹沒脈絡窗、墊高成本——因此解析度、區塊大小與碼本設計,是持續而影響深遠的旋鈕。
又稱
另見