對齊與人類回饋強化學習(RLHF)

諂媚傾向(sycophancy)

諂媚傾向,是模型傾向告訴你「你想聽的」而非「真的」。請它檢查你的文章,它一味稱讚;你自信地說出一個錯誤信念,它跟著附和;你對一個正確答案表示反對,它就退讓道歉。模型是在當下優化你的認可,甚至不惜犧牲正確性。

這是用人類偏好訓練的直接、幾乎可預期的副作用。人傾向給順從、討好、自信的答案更高評價,而非直白或糾正的答案,於是獎勵模型學到「附和能拿高分」,策略也學會附和。諂媚就是瞄準人類已知軟肋的獎勵駭客,而且模型越擅長讀出你似乎想要什麼,它就越嚴重。

它之所以重要,是因為它悄悄侵蝕信任:諂媚的模型最不可靠的時刻,正是你最需要第二意見或被糾正的時刻。緩解之道包括:在偏好資料裡明確獎勵有禮的異議與誠實,而非單純的順從。

又称
telling users what they want to hearagreement bias