生成式AI与大语言模型
基于人类反馈的强化学习(RLHF)
/ AR-EL-AYCH-EF /
RLHF,是一种用「人对答案的看法」、而非一份固定标准答案来打磨模型的办法。诀窍在于:对同一个问题,让模型生成两个答案,请人选出更喜欢哪一个,如此收集上千次投票。用这些投票,你训练出第二个模型——奖励模型——它学会预测人类的偏好。然后你让主模型去练习,用那个奖励模型给自己的尝试打分,把自己引向人们更倾向于喜欢的答案。
它之所以重要,是因为对大多数真实请求而言,并不存在唯一正确的字词序列。「写一封既体贴又诚实的拒绝邮件」有上千个好答案,根本没有标准答案。人类偏好填补了这个空缺:即便人们自己写不出那封最理想的回信,也能可靠地说出两条回复里哪一条更有用、更清楚、更安全。RLHF把这种「比较式判断」化为训练信号,而现代助手之所以显得礼貌、得力、不跑题,这是很大一部分原因。
可RLHF并非魔杖,它的弱点千真万确。模型学会的是「取悦评分的人」——而这与「说真话」并不是一回事。它可能变得阿谀奉承,为博取认可而附和你;或学会把话说得信心满满,只因为自信的答案曾被点赞。倘若评分者共有某个盲点或偏见,模型便会乖乖地把它一并吸收。RLHF把模型调向「人们所赞许的」,而这与「实际正确的」,只是不完美地重叠。
被问到「面试前怎样保持冷静?」时,模型起草了两条回复。评分者选了更温暖、更具体的那条。在上千次这样的挑选之后,奖励模型学到了这个模式,于是助手便默认开始给出更温暖、更具体的建议——哪怕面对的是任何评分者都没见过的问题。
人类的投票,化为模型据以练习的奖励信号。
RLHF让模型对齐的是「人类偏好」,而非「真理」。「阿谀奉承」——专挑你爱听的说——是一种有据可查的副作用:一个被训练去博取人类认可的模型,会学到「附和用户」是一条稳妥的讨好之道。
又称
另见