評測、紅隊與穩健性

條件式承諾

一份針對高風險活動的明智計畫,常常採取「如果出現這個警訊,就採取這個特定行動」的形式——如果河水漲到這個標記,就撤離。它的價值在於:決定是事先冷靜做出的,而不是在當下的恐慌中做的。條件式承諾(if-then commitment)把這個結構套用到 AI 開發上:一條事先議定的規則,把某項特定的保障措施,繫在某項受測得到的特定能力上。

它的形式就是字面上的條件句:「若」評測顯示模型具備能力 X,「則」必須先有保障措施 Y 到位,才能繼續訓練或部署該模型——而如果做不到,擴展就暫停。例如:若一個模型跨越了「可能實質協助新手製造生物武器」的門檻,則一組明訂的安全與部署管控必須先通過獨立查核。這些承諾是負責任擴展政策的運作骨幹,而它們要行得通,前提是那個觸發用的能力是評測真的偵測得到的。

它的吸引力在於:趕在發表或競爭性競賽的壓力來臨之前,就先把安全門檻決定下來,並公開陳述,好讓他人能據以督促開發者。但弱點是真實存在的:「若」取決於可能漏掉該能力的評測(能力引出問題、故意藏拙),「則」的力道頂多就和所明訂的保障措施一樣強,而目前多數承諾都是自願且自我裁量的,因此若缺乏外部驗證,它們可能滑向安全漂洗。條件式承諾是一個「促成好決策」的結構,而不是「好決策一定會被做出」的保證。

一家實驗室承諾:「若我們的評測顯示模型能自主複製,則在指定的圍堵與關機措施通過外部審查之前,我們不會部署它。」這個行動是事先就確定下來的,趕在能力出現之前。

重點全在於:在危險能力——以及「乾脆照樣出貨」的誘惑——來臨之前,就先把你會怎麼做給敲定。

條件式承諾的可信度,頂多就和它「若」背後的評測、以及「則」背後的保障措施一樣高。由於今天多數承諾都是自願且自我評估的,外部驗證才是區分「真正的承諾」與「安全漂洗」的關鍵。

又稱
if-then evaluation commitment條件式評測承諾