学习范式
零样本学习(zero-shot learning)
/ ZEE-roh-shot LER-ning /
告诉一个从没见过斑马的人,斑马就是「一匹带黑白条纹的马」,他到了动物园第一眼就能认出来。他从没看过实物——他靠的是一句描述,加上自己原本就懂的关于马和条纹的知识。零样本学习把这种本事给了机器:对一个它恰好得到零个训练样本的类别或任务,它靠一句描述、一个名称或共享的知识来应对。
它的做法,是把事物都映射进一个共同的「意义空间」。模型学的不是「这一团像素等于第7类」,而是学会把输入与文字描述联系起来——于是一个它从未训练过的新类别,仍能通过其描述被认出。当代的大语言模型和视觉-语言模型天生就会这一手:它们在浩瀚的文本与图文配对数据上训练过,便能给一张照片打标签、或回答关于某个类别的问题,哪怕这个类别从未作为带标签样本出现过,因为这个概念早已活在它读过的文字里。
零样本很了不起,但要清醒地看待这个「零」字。它指的是零个任务专属样本,而非零知识——模型完全倚仗它预训练时见过的广泛数据,所以一个真正在那批数据里缺席的概念,仍然够不着。它的准确度通常低于、也比用真实样本训练的模型更脆弱,而且对你描述或提示的具体措辞十分敏感。零样本是个不错的起点,却不是能稳妥替代正经训练的保票。
有人问一个视觉-语言模型:「这是雪豹的照片吗?」——而它从未被明确训练去分类这个物种。但因为它在预训练时学会了把图像与文字说明联系起来,而「雪豹」这个词在那些文字里出现过,于是它仅凭描述就答对了,没用过一张雪豹的训练样本。
没有这个类别的训练样本——只凭它的描述和先验知识。
「零样本」指的是某项具体任务的零个样本——而非零知识。这份能力完全借自广泛的预训练,因此那批数据里缺席的概念仍然够不着,准确度通常也弱于用真实样本训练。
又称
另见