建構大型語言模型應用與前沿
小型語言模型(small language models,SLMs)
不是每一項任務都需要最大、最貴的模型。小型語言模型(small language models,SLMs)——大約是幾億到幾十億個參數——是刻意做得精簡的模型,跑得便宜又快,往往在單一張 GPU 上、甚至在一支手機上就能跑,卻仍能把許多真實工作做得不錯。近來令人意外的,是它們變得有多能幹:在高品質資料上細心訓練,能讓一個小模型在聚焦的任務上,追平兩三年前一個大得多的模型。
小模型靠的是更好的資料與訓練,而非單純的尺寸,來達到有用的品質:大量的資料篩選與去重、用比過去縮放律所建議更多的詞元來訓練、從一個更大的教師模型蒸餾知識,以及在目標任務上做窄而專的微調。對於一個明確界定的特定工作——分類、抽取、路由、用已知格式做摘要——一個微調過的小模型,能以遠低的成本與延遲,追平甚至勝過一個龐大的通用模型。
小模型是用廣度換效率。比起前沿模型,它們的一般推理較弱、世界知識較少,面對雜亂開放的請求餘裕也較小,所以它們適合狹窄而高流量的任務,而非什麼都能做的助理。它們的崛起重塑了應用設計:與其把所有東西都路由到一個昂貴模型,團隊越來越常動用一支小型專家的艦隊,把旗艦留給真正困難的案例。
又称
另见