學習範式

零樣本學習(zero-shot learning)

/ ZEE-roh-shot LER-ning /

告訴一個從沒見過斑馬的人,斑馬就是「一匹帶黑白條紋的馬」,他到了動物園第一眼就能認出來。他從沒看過實物——他靠的是一句描述,加上自己原本就懂的關於馬和條紋的知識。零樣本學習把這種本事給了機器:對一個它恰好得到零個訓練樣本的類別或任務,它靠一句描述、一個名稱或共享的知識來應對。

它的做法,是把事物都映射進一個共同的「意義空間」。模型學的不是「這一團像素等於第7類」,而是學會把輸入與文字描述聯繫起來——於是一個它從未訓練過的新類別,仍能透過其描述被認出。當代的大型語言模型和視覺-語言模型天生就會這一手:它們在浩瀚的文字與圖文配對資料上訓練過,便能給一張照片打標籤、或回答關於某個類別的問題,哪怕這個類別從未作為帶標籤樣本出現過,因為這個概念早已活在它讀過的文字裡。

零樣本很了不起,但要清醒地看待這個「零」字。它指的是零個任務專屬樣本,而非零知識——模型完全倚仗它預訓練時見過的廣泛資料,所以一個真正在那批資料裡缺席的概念,仍然夠不著。它的準確度通常低於、也比用真實樣本訓練的模型更脆弱,而且對你描述或提示的具體措辭十分敏感。零樣本是個不錯的起點,卻不是能穩妥替代正經訓練的保票。

有人問一個視覺-語言模型:「這是雪豹的照片嗎?」——而它從未被明確訓練去分類這個物種。但因為它在預訓練時學會了把影像與文字說明聯繫起來,而「雪豹」這個詞在那些文字裡出現過,於是它僅憑描述就答對了,沒用過一張雪豹的訓練樣本。

沒有這個類別的訓練樣本——只憑它的描述和先驗知識。

「零樣本」指的是某項具體任務的零個樣本——而非零知識。這份能力完全借自廣泛的預訓練,因此那批資料裡缺席的概念仍然夠不著,準確度通常也弱於用真實樣本訓練。

又稱
zero-shot零样本学习零樣本學習