基礎模型(foundation model)
/ fown-DAY-shun MOD-ul /
基礎模型,是指在一大堆龐雜、寬泛的資料上——文本、圖像,或二者兼有——訓練出的單個超大模型,目的在於日後能被適配到許多不同任務上,而不必為每項任務從零另起爐灶。這個名字道出了核心:它是一個公共的「地基」,你在它之上蓋起許多具體的應用,就像一塊結實的混凝土基座可以撐起一棟住宅、一間店鋪,或一座辦公大樓。今天聊天機器人背後的大語言模型,就是最廣為人知的例子。
讓它成立的,是一套兩階段的配方。第一步是預訓練:模型消化一個龐大而通用的語料,在不針對任何單一工作的情況下,學到語言或視覺的豐富規律——這一步極其昂貴,且只做一次。第二步是適配:同一個模型被微調、被提示,或以其他方式專門化,以應對某項具體任務——給法律文件做摘要、回答客戶提問、為照片配字幕——而代價只是預訓練的極小一部分。2018至2020年間這類模型的浪潮,以及2021年「基礎模型」一詞的提出,標誌著一個轉變:從「每項任務造一個窄模型」,轉向「處處複用同一個通用模型」。
好處在於覆蓋面與效率:一個模型能驅動無數下游用途,且往往靈活得出人意料。而誠實地說,那些壞處同樣重要。這些模型訓練起來昂貴又耗能;它們會吸收訓練資料裡的偏見與錯誤;它們能流利又自信地說出虛假之詞(即所謂「幻覺」);又因為有這麼多東西押在少數幾個大模型上,它們的缺陷會廣泛傳播開來。它們是強大的通用工具——而不是神諭,也不是心智。
一家醫院、一間律所、一個遊戲工作室,可能都建立在同一個底層語言模型之上。醫院用病歷對它做微調,律所提示它起草合約,工作室用它來寫對白。一個昂貴的地基,三個便宜而迥異的應用——而這個地基裡的任何缺陷或偏見,都會悄悄出現在這三者之中。
一個昂貴的基礎模型,許多便宜的專門用途——還有隨它一同傳播的共有缺陷。
基礎模型的「通用」,指的是可跨任務複用——而不是「通用人工智慧」那個意義上的通用。它仍然是一個模式匹配器,能說得既流利又自信地犯錯;用途之廣,並不等於它真的理解。