生成式AI與大型語言模型
多模態模型(multimodal model)
/ muhl-tee-MOH-dul MOD-ul /
多模態模型,是一種能處理不止一種輸入或輸出的模型——不只是文字,還有圖像、音訊或影片,且常常是幾樣混在一起。你可以給它看一張照片、就照片提問,遞給它一張圖表、問它趨勢如何,或對它說話、再收到它說出來的話。「模態」不過是指一種訊號的類型——文字、視覺、聲音——而「多模態」就是說,這個模型在同一套系統裡同時拿捏好幾種。
讓這成為可能的訣竅,是把每一種輸入都換成同一種內部貨幣:一長串數字(嵌入),它們活在一個共享的空間裡,於是一張狗的照片和「狗」這個字,會落到彼此相鄰處。一旦圖像、聲音和文字統統變成了同一套機器能處理的數字序列,單個模型便能跨越它們來推理——讀出照片裡的文字、描述一幕場景,或把一句口頭請求對上一個視覺答案。如今大多數領先的助手,都是這樣意義上的多模態。
對這意味著什麼,要腳踏實地。把圖像和文字一併處理,並不賦予模型類似人類的知覺或理解;它依舊是模式匹配,只是如今跨越了更多種類的模式。一個視覺—語言模型可能看錯鐘面、數錯物體、信心十足地描述出一樣圖裡根本沒有的東西,或被一張人絕不會看走眼的圖騙到。模態越多,它能嘗試的範圍越寬——而它信心十足地犯錯的餘地,也隨之越寬。
你拍下冰箱內部、問「今晚能做點什麼菜?」模型在圖裡認出了雞蛋、菠菜和起司,把這些視覺概念與它從文字裡學來的食譜連起來,回你一份義式煎蛋的做法——一步之內,便在視覺與語言之間架起了橋。
一個模型,兩種感官:它看圖,再用文字作答。
「多模態」並不意味著模型像人一樣去知覺。它依舊是在做模式匹配——只是如今也涵蓋了圖像與音訊——並且會信心十足地看錯圖表、數錯物體,或描述出實際並不存在的東西。感官多了,被騙的門路也多了。
又稱
另見