人工智慧安全與對齊

憲法式人工智慧(Constitutional AI, CAI)

憲法式人工智慧讓模型依據一份簡短的成文原則清單(即「憲法」)來自我監督,而不必倚賴大批人類標註者去逐一標記每個糟糕回答。可以想像把一份行為準則交給模型,要求它在自己的草稿偏離準則時自行評分並改寫。人類的角色因此縮小到撰寫規則與少數示例,大部分的對齊訊號則由模型自己產生。

它分成兩個階段。在監督階段,模型先抽樣一個回應,依據隨機抽到的某條原則批判該回應,再加以修訂,並用修訂後的答案進行微調。在強化階段,同一個模型判斷成對回應中哪一個更符合憲法,產生 AI 偏好標籤來訓練一個獎勵模型,再由它驅動策略最佳化。於是無害性來自自我批判與 AI 生成的偏好,而非來自人類去排序有害輸出。

它的吸引力在於透明與可擴展:價值觀是你能讀、能改的明文,而且不必讓標註者暴露於令人不安的內容。代價是模型只能執行它本就理解且願意套用的原則,因此一份薄弱或含糊的憲法,或一個誤讀憲法的模型,都會悄悄限制最終結果能有多安全。

憲法並不會在推論時直接約束模型,它形塑的是訓練資料,所以安全程度取決於模型能否把原則套用在自己身上。

又称
CAI憲法式 AIRLAIF with a constitution