生成式AI与大语言模型

微调(fine-tuning)

/ FYNE-too-ning /

微调,是拿一个本已通晓诸多通识的模型,给它上一门聚焦、规模小得多的训练课,让它在某一件特定的事上变得拿手。想象一位博览群书的毕业生,几乎什么题目都能写;微调,就是那几周让她变成一名称职律师助理的在职培训。广博的底子早已在那儿,你只是把它往一条更窄的沟槽里轻轻一推。

技术上,你从一个预训练好的模型出发,在一份精心整理的数据集上继续训练它——比方说几千条医学问答的范例。模型内部的那些数字(它的权重)会微微挪动,去贴合新的例子。因为它在预训练阶段已经学会了语言,所需的数据和算力,远比从零开始要少得多。像LoRA这样的变体,只调整模型的一小片而非全部,让这件事变得更便宜。

两点要诚实说明。其一,微调可能引发「灾难性遗忘」:在新任务上用力过猛,模型会丢掉一部分原有的通用本领。其二,微调注入「文风与模式」远比注入「新事实」可靠得多——若你想让模型用上特定的、最新的知识,检索增强生成(在提问时把文档喂给它)往往比试图把事实硬烤进权重里要稳妥。

一家银行从一个通用语言模型出发,在5000段过往的客服对话上对它做微调。之后,它便能用这家银行的口吻作答、记得产品名称、遵守内部规程——而无须有谁把模型从零重训一遍,那要贵上千倍。

一门小而聚焦的课,把通才变成专才。

一个常见的错误,是在其实需要「检索」时却去做「微调」。如果问题是「模型不知道我们最新的价格」,那么在提问时把价目表喂给它,通常胜过微调;微调真正擅长的是改变模型的「行事方式」,而非储存那些不断变动的事实。

又称
finetuning微调微調适配domain adaptation