負責任擴展政策(responsible scaling policy)
/ RSP /
想想工地如何事先張貼規則:「若風速超過此值,停止吊車作業」,這是在風平浪靜時冷靜決定的,而不是在暴風中途才來爭辯。負責任擴展政策就是公司試圖對「打造愈來愈強大的 AI」做同樣的事:事先寫下哪些能力會危險到需要特定的防護措施,並承諾在跨越那條線之前先把那些防護措施準備好。
具體而言,一份 RSP 會定義能力門檻(有時稱為安全等級),並為每個門檻配上所需的保護措施。其結構是一種「若—則」承諾(if-then commitment):「若我們的模型能做到 X,則我們會在繼續推進之前先備妥防護措施 Y。」例如:若一個模型變得能實質提升一個新手製造生物武器的能力,政策可能就要求嚴格的存取控制、更強的權重防竊資安,以及在進一步擴展或部署之前通過某些評測。主要的前沿實驗室已以各種名稱發布了這類政策(負責任擴展政策、準備度框架、前沿安全框架),它們高度仰賴危險能力評測,來偵測門檻何時被觸及。
RSP 的價值,在於它是一種把安全變得具體、並在誘因較為平靜時就事先決定的方式,而不是在競爭壓力下臨時拼湊。但它們是自願性的自我監管,而這正是其核心侷限。一家公司可以弱化、重新詮釋,或悄悄放棄自己的政策;門檻可能被設在剛好方便的地方;執行則大致仰賴聲譽。支持者把它們視為務實的第一步、以及日後具約束力規則的範本;懷疑者則警告,除非有外部查核撐腰,否則它們可能淪為「安全洗白」(safety-washing):徒有嚴謹的外觀,卻沒有牙齒。
某實驗室的政策載明:一旦它的模型通過某個既定的「生物能力提升」評測,在它強化權重防竊資安、且一支外部團隊確認防護措施有效之前,它就不會再進一步部署。
RSP 是一種「事前承諾」:防護措施在危險能力到來「之前」就決定好,而不是之後。
RSP 是自願且自我定義的,因此一份政策的強度,僅取決於公司願不願意遵守它。若缺乏獨立查核,它們可能逐漸滑向「安全洗白」:看起來嚴謹,但真正的承諾卻悄悄軟化。