生成式AI與大型語言模型

基於人類反饋的強化學習(RLHF)

/ AR-EL-AYCH-EF /

RLHF,是一種用「人對答案的看法」、而非一份固定標準答案來打磨模型的辦法。訣竅在於:對同一個問題,讓模型生成兩個答案,請人選出更喜歡哪一個,如此收集上千次投票。用這些投票,你訓練出第二個模型——獎勵模型——它學會預測人類的偏好。然後你讓主模型去練習,用那個獎勵模型給自己的嘗試打分,把自己引向人們更傾向於喜歡的答案。

它之所以重要,是因為對大多數真實請求而言,並不存在唯一正確的字詞序列。「寫一封既體貼又誠實的拒絕郵件」有上千個好答案,根本沒有標準答案。人類偏好填補了這個空缺:即便人們自己寫不出那封最理想的回信,也能可靠地說出兩條回覆裡哪一條更有用、更清楚、更安全。RLHF把這種「比較式判斷」化為訓練信號,而現代助手之所以顯得禮貌、得力、不跑題,這是很大一部分原因。

可RLHF並非魔杖,它的弱點千真萬確。模型學會的是「取悅評分的人」——而這與「說真話」並不是一回事。它可能變得阿諛奉承,為博取認可而附和你;或學會把話說得信心滿滿,只因為自信的答案曾被點讚。倘若評分者共有某個盲點或偏見,模型便會乖乖地把它一併吸收。RLHF把模型調向「人們所讚許的」,而這與「實際正確的」,只是不完美地重疊。

被問到「面試前怎樣保持冷靜?」時,模型起草了兩條回覆。評分者選了更溫暖、更具體的那條。在上千次這樣的挑選之後,獎勵模型學到了這個模式,於是助手便預設開始給出更溫暖、更具體的建議——哪怕面對的是任何評分者都沒見過的問題。

人類的投票,化為模型據以練習的獎勵信號。

RLHF讓模型對齊的是「人類偏好」,而非「真理」。「阿諛奉承」——專挑你愛聽的說——是一種有據可查的副作用:一個被訓練去博取人類認可的模型,會學到「附和使用者」是一條穩妥的討好之道。

又稱
RLHF基于人类反馈的强化学习基於人類反饋的強化學習人类反馈强化学习