多模態大型語言模型
任意模態大型語言模型(any-modality LLM)
任意模態大型語言模型(any-modality LLM)是這個光譜最具野心的一端:一個網路能把文字、影像、音訊、影片都當輸入,並能產出其中好幾種——用語音描述一張照片、從一段文字生成影像、用文字回答口頭問題。目標不是替每項任務在語言模型旁外掛一個工具,而是一套統一的系統,能流暢地混用一段對話所需的任何模態。
統一的關鍵想法是把一切都詞元化。如果影像、音訊、影片都能像文字早已做到的那樣,被轉成共享詞彙表裡的離散詞元,那麼一個 Transformer 就能用同一套逐詞元的機制跨模態地讀與寫。輸出再經過各模態專屬的解碼器,把預測出的詞元變回像素或聲音。有些系統則改為路由到專門的生成器;任意對任意(any-to-any)這個標籤兩種設計都涵蓋。
通用是要付代價的。樣樣模態都會的,往往在每一項上都落後於專才,而訓練這種模型既吃資料又不穩定。真正天衣無縫的任意對任意系統仍是活躍的研究前沿,而非已解決的產品。
又稱
另見