對齊與人類回饋強化學習(RLHF)
有用、無害、誠實(helpfulness, harmlessness, honesty)
有用、無害、誠實——常簡稱 HHH——是「對齊後的助理該是什麼樣子」最精煉的說法。有用,指真的解決使用者的問題、追隨他們的意圖,而不只照字面執行。無害,指不對使用者或他人造成或助長傷害。誠實,指不欺騙、不捏造事實,並對不確定與侷限坦白。
三者要並列陳述,是因為它們彼此拉扯,而有意思的工作正在於這些取捨。對危險請求最「有用」的回答會造成傷害;最謹慎、最「無害」的策略會連有用的事都拒絕、顯得沒用;不加分寸的純粹「誠實」可能直白到傷人或幫不上忙。對齊很大程度上就是在壓力下、一個提示接一個提示地拿捏這些平衡的工夫。
這三項是偏好資料、獎勵模型與憲法都試圖落實的高層目標。它們刻意寬泛——是指南針,不是規則手冊——因為任何固定的規則清單,一碰上真實請求的全部多樣性就會失效。
又称
另见