對齊與人類回饋強化學習(RLHF)

憲法式 AI(Constitutional AI)

憲法式 AI 把模型對齊到一份簡短的書面原則——一部「憲法」——而不只依賴逐案的人類標註。它的想法是讓價值明示且可調控:與其讓數千名標註者各自隱性決定「無害」是什麼意思,不如把原則寫下來,再讓模型協助套用。

它分兩個階段執行。在監督階段,模型對照憲法批評並修改自己的回覆,產生更安全的答案供學習。在強化階段,模型比較自己成對的回覆、標出哪一個更符合原則,產生由 AI 生成的偏好資料,再以一般 RLHF 的方式訓練獎勵模型。憲法仍由人類撰寫與精修;把它大規模套用的勞力則轉移給模型。

它的吸引力在於透明與規模:價值存在於你能閱讀、能辯論、可編輯的文字裡,而你需要遠少於以往的人去標註可能令人不適的內容。風險則是:真正被優化的,是模型對某條原則的理解,而非你原本想要的理解。

又称
CAIprinciple-based alignment