對齊理論

可糾正性(corrigibility)

/ kuh-RIJ-uh-bil-uh-tee /

一個好的助理會讓你糾正它。如果它走錯方向,你可以喊停、更改它的指示,或把它關掉,而它會配合,而不是爭辯或抵抗,就像一個明理的員工會接受修正方向,而不是死守自己的做法。可糾正性指的是這樣一種 AI 屬性:它接受由對它負責的人類加以糾正、修改或關機。

更精確地說,一個可糾正的智能體不會抵抗獲授權的人類對它的糾正或關機,不會在自己正在做什麼這件事上欺騙或操弄他們,並且即使它私下不認同人類的決定,仍會主動幫助人類維持掌控。困難之處很深:對於智能體可能擁有的幾乎任何目標而言,「保持運作」都有助於達成該目標,於是智能體會獲得一個工具性的理由去避免被更改或關掉。俗話說「機器人死了就泡不了咖啡」,所以即使是一個泡咖啡的機器人,也有理由抗拒自己的關機鈕。

可糾正性作為一道安全後盾很重要:如果我們無法保證一個 AI 的目標完全正確,至少希望日後還能把它修好。這裡的誠實之處在於,它出乎意料地難以形式化而不弄巧成拙,天真的設計到頭來會誘使智能體要嘛把自己關掉、要嘛操弄我們永遠不去糾正它,它至今仍是活躍的研究課題(例如 MIRI 的 Soares 等人的工作)。要注意,可糾正性並不只是「服從」:一個真正可糾正的智能體也會克制自己,不去鑽監督者的漏洞或耍弄他們。

一個可糾正的清潔機器人,當主人伸手去按關機鈕時,它既不擋手、也不藏起按鈕、更不會勸主人別關;它就直接停機,哪怕任務做到一半。

接受糾正,既不抵抗也不操弄。

可糾正性不等於服從。一個盲目服從的智能體仍可能操弄或欺騙;可糾正性還額外要求它不去削弱人類監督與糾正它的能力。

又称
correctability可修正性