差異化科技發展(differential technological development)
如果你無法阻止一條路被蓋起來,你至少還能堅持:在車子變快之前,煞車和紅綠燈要先就位。差異化科技發展就是把這個想法用在 AI 上:既然徹底停下進展並不現實,策略就是刻意讓「具保護性、能降低風險」的技術,相對於「危險、會增加風險」的技術,加速推進。它不是要停下 AI;它是要改變各種能力「到來的順序」。
具體在 AI 上,這意味著設法讓與安全相關的進展,對齊技術、可解釋性工具、可靠的評測、監督方法,跟上、最好是領先純能力的增長,而不是落在後面。它的動機正是「能力與對齊」的落差:如果「建造強大系統的能力」一路狂奔,快過「對齊與驗證它們的能力」,我們就會部署一些自己還無法保證安全的東西。差異化發展要求每一個行為者,以及整個領域,在安全那一側投入不成比例的資源,好讓「保護性工具」在「強大能力」出現時就已經存在。
這裡有誠實的張力。有些安全研究需要建造或研究有能力、甚至危險的系統,所以「安全工作」與「能力工作」的界線可能模糊,同一項進展可能兩面都切。還有一個協調問題:一家謹慎的實驗室若放慢自己的能力工作,可能只是把地盤拱手讓給比較不謹慎的競爭者,這正是差異化發展連到治理、以及「減少競賽動態」相關想法的原因。它是一項指導原則與一種期望,而非一道精確公式,理性的人對於在具體案例中該如何應用它,意見不一。
一家實驗室決定:在把模型擴展到新的能力層級之前,它要先大舉投資於「能檢視這種模型」的評測與可解釋性工具,好讓安全的機制事先就位,而不是發布之後才手忙腳亂湊出來。像這樣把安全排在能力之前,就是差異化發展的實際運作。
刻意安排讓安全工具,在它們必須檢查的能力出現之前先到位。
差異化發展是一個難以乾淨執行的理想。安全研究與能力研究常常重疊,而單一行為者放慢腳步,可能只是把地盤輸給別人,這正是為什麼這個想法通常要與治理和協調搭配,而非單靠它自己。