多模態大型語言模型
多模態大型語言模型(multimodal LLM)
一般的大型語言模型只會讀寫文字。多模態大型語言模型(multimodal LLM)還能吃進非文字的東西——一張照片、一張截圖、一張圖表、一段語音、幾秒鐘的影片——並在同一段對話裡推理。你可以貼一張冰箱內容的照片問該煮什麼,或丟給它一張 X 光片、一份數學考卷、一首歌。模型把影像或聲音當成你文字旁邊的另一段脈絡。
它骨子裡仍是逐詞元預測的文字模型。一個獨立的編碼器把非文字輸入轉成一串向量,一個小小的投影器把這些向量重塑到和詞嵌入相同的空間,再像額外的詞元一樣插進提示裡。Transformer 接著同時對文字與影像區塊做注意力。真正新增的只是一座細細的橋;語言大腦是沿用的。
這個詞要小心:多模態通常指理解額外的模態,而不是生成它們。大多數這類模型仍然只輸出文字,要產生圖片或聲音得另接一個生成器。它們也繼承了文字模型的每一個弱點——可能很有自信地誤讀一張圖表,或幻想出影像裡根本沒有的細節。
又称
另见