生成式AI与大语言模型
多模态模型(multimodal model)
/ muhl-tee-MOH-dul MOD-ul /
多模态模型,是一种能处理不止一种输入或输出的模型——不只是文本,还有图像、音频或视频,且常常是几样混在一起。你可以给它看一张照片、就照片提问,递给它一张图表、问它趋势如何,或对它说话、再收到它说出来的话。「模态」不过是指一种信号的类型——文字、视觉、声音——而「多模态」就是说,这个模型在同一套系统里同时拿捏好几种。
让这成为可能的诀窍,是把每一种输入都换成同一种内部货币:一长串数字(嵌入),它们活在一个共享的空间里,于是一张狗的照片和「狗」这个字,会落到彼此相邻处。一旦图像、声音和文字统统变成了同一套机器能处理的数字序列,单个模型便能跨越它们来推理——读出照片里的文字、描述一幕场景,或把一句口头请求对上一个视觉答案。如今大多数领先的助手,都是这样意义上的多模态。
对这意味着什么,要脚踏实地。把图像和文本一并处理,并不赋予模型类似人类的知觉或理解;它依旧是模式匹配,只是如今跨越了更多种类的模式。一个视觉—语言模型可能看错钟面、数错物体、信心十足地描述出一样图里根本没有的东西,或被一张人绝不会看走眼的图骗到。模态越多,它能尝试的范围越宽——而它信心十足地犯错的余地,也随之越宽。
你拍下冰箱内部、问「今晚能做点什么菜?」模型在图里认出了鸡蛋、菠菜和奶酪,把这些视觉概念与它从文字里学来的食谱连起来,回你一份意式煎蛋的做法——一步之内,便在视觉与语言之间架起了桥。
一个模型,两种感官:它看图,再用文字作答。
「多模态」并不意味着模型像人一样去知觉。它依旧是在做模式匹配——只是如今也涵盖了图像与音频——并且会信心十足地看错图表、数错物体,或描述出实际并不存在的东西。感官多了,被骗的门路也多了。
又称
另见