微調與適配
蒸餾到較小的 LLM(distillation)
蒸餾就是教一個又小又便宜的模型去模仿一個又大又昂貴的模型。龐大的「老師」示範它會怎麼回應,「學生」則學著去對齊它——最後變得快上許多、輕巧許多,卻保住了老師大部分的本事。
在經典的形式裡,學生被訓練去對齊老師對下一個詞元的完整機率分布(也就是「軟標籤」),而這比單一個正確答案承載了更豐富的資訊。一個較簡單、如今也很常見的變體,則只是拿老師生成的文字來微調學生。無論哪一種,學生都捕捉到了老師付出高昂代價才學會的行為。天花板就是老師:學生很少能超越它所模仿的對象,而且可能繼承老師的缺陷。
許多又小又能部署的模型,就是這樣做出來的——把前沿模型的品質,轉化成能在手機上跑、或能大規模便宜運行的東西。
又称
另见