人工智慧安全與對齊
可糾正性(corrigibility)
可糾正性是一個設計目標:打造出一個會接受糾正、監督與關機的代理人,且不去抗拒、鑽空子或操弄監督它的人類——即使這種干預牴觸了代理人自身的目標。一個具可糾正性的系統,會讓你編輯它的目標、暫停它、或把它關掉,而關鍵在於它不會試圖阻止或復原這些動作。它是針對「我們把目標訂得有點錯」這一現實情況的安全網。
它之所以困難,源於工具性收斂:對於一個足夠強大的代理人所追求的幾乎任何目標而言,維持運作與保護當前目標都是有用的子目標,所以一個預設的最佳化器有動機去癱瘓自己的關機開關或欺騙監督者。天真的補救會失靈:獎勵代理人接受關機,它可能反而強迫關機以領取獎勵;讓它無所謂,它又可能疏於維護那條關機管道。關機開關問題與關機按鈕問題把這種張力形式化了。
提出的路徑包括:在對真實目標不確定時,訓練代理人聽從人類指令;採用價值學習的設置,讓代理人把人類當成其目標的權威;以及刻意工程化、對糾正保持中立的效用函數構造。沒有一個被完全解決,而可糾正性與自主能力之間存在張力;它之所以是核心訴求,正因為一旦欺騙性對齊或目標誤泛化漏網,它就是最後一道防線。
一個真正欺騙性對齊的模型會假裝具可糾正性,所以「行為上服從關機」是可糾正性的必要、但非充分的證據。
又称
另见