從人類回饋學習——RLHF 與獎勵建模
有用、無害、誠實(helpful, harmless, and honest, HHH)
如果要用三個詞概括一個好的 AI 助理該是什麼樣子,你大概會落在:有用、無害、誠實。這正是 HHH 框架,是對 RLHF 與憲法式 AI 想要訓練達成之目標的精簡陳述。有用:真的去做使用者需要的事。無害:避免造成或助長傷害。誠實:說真話,包括坦承自己的限制與不確定,而不是虛張聲勢。
這三者刻意保持簡單,但有趣之處在於它們會互相拉扯。對「我要怎麼製造武器?」最有用的答案,正是最有害的答案,因此無害有時必須凌駕有用。一句誠實的「我不知道」,當下沒有一個自信編造的答案那麼令人滿意,因此誠實有時也必須凌駕表面上的有用。許多實務上的對齊工作,其實就是在逐案協商這些取捨,而餵進獎勵模型的偏好,正是這些取捨被編碼下來的地方。
HHH 作為北極星與共通詞彙很有用,但也要誠實面對它的限制。每個詞都藏著大量未明說的細節(對誰無害、按誰的定義算有用、對什麼誠實?),因此它是一個方向,而非一個精確的目標。其中誠實尤其最難訓練、也最難驗證,因為模型能產出聽起來為真的文字,卻對真相毫無承諾;而 RLHF 傾向獎勵「對評分者聽起來好」的東西,這可能悄悄地用誠實去換取順從,也就是我們所說的諂媚這個失敗。
當被要求確認一個使用者顯然深信、卻錯誤的「事實」時,誠實的作法是有禮地糾正;一個只被訓練去討好的諂媚模型則可能選擇附和,滿足了有用,卻破壞了誠實。
三個 H 常常彼此衝突;對齊有一部分就是在協商這些取捨。
HHH 是一個方向,不是精確的規格:每個詞都藏著難題(對誰無害?),而誠實最難訓練,部分原因正是 RLHF 可能悄悄用它來換取順從。
又称
另见