生成式AI与大语言模型

指令微调(instruction tuning)

/ in-STRUK-shun TOO-ning /

指令微调,是教模型去「做你要求的事」、而非仅仅「续写你的文字」的那一步训练。一个未经雕琢的预训练模型是自动补全的高手:你打「写一首关于大海的诗」,它可能乐呵呵地回你「也写一首关于群山的诗」,因为那是一句说得通的下文。指令微调纠正了这一点——它给模型看上千个「请求,随后是一段好回答」格式的例子,直到模型学会:请求是用来「满足」的,而不是用来「重复」的。

机理上,它是一种微调,在一份涵盖众多任务类型的「指令—答案」配对数据集上进行——概括这个、翻译那个、解释这个概念、修这段代码。模型学会了一种通用习惯:把用户的话当成命令来对待。仅这一步,就在很大程度上把几年前那些笨重的文字预测器,变成了人们如今天天与之闲聊的得力助手。

不过要把它的局限说清楚。指令微调让模型「愿意且能够」听从指令;它并不让模型「正确」。一个指令微调得很好的模型,会信心十足地顺着一个请求一路走向错误答案,也可能被诱导去执行有害的指令。可靠与安全,还需更进一步的工夫——通常是在其上叠加像RLHF这样的人类反馈方法。

之前:当被提示「列举回形针的三种用途」时,未经雕琢的模型写出「列举订书机的三种用途」——纯粹是听起来说得通的文字。经过指令微调后,同样的提示会给出一份真正的、回形针用途的编号清单。

从「续写我的文字」到「做我要求的事」的转变。

指令微调(也叫监督微调,SFT)通常是「对齐」的第一阶段,其后才是RLHF或DPO之类的偏好方法。SFT教给模型「乐于助人」的形态;偏好阶段则进一步打磨:在几个说得通的答案里,人们究竟更喜欢哪一个。

又称
instruction fine-tuningsupervised fine-tuningSFT指令微调指令微調监督微调