治理與災難性風險
前沿模型(frontier model)
想像探險家還在繪製的地圖的最前緣:再往前一點,就是無人勘測過的疆域。前沿模型就是一個正好坐落在能力最前緣的 AI 系統,屬於人類所打造過最強大的通用模型之列,能做到先前任何系統都無法穩定做到的事。「前沿」這個詞身兼兩義:這些系統既是最有能力的,也是最不被理解的。
更具體地說,「前沿模型」通常指一個處於或超越當前技術水準、且若遭誤用或行為偏離預期就可能帶來嚴重風險的通用 AI(一般是用海量資料訓練出來的大型模型)。由於「最有能力」這件事很模糊,監管者常退而求其次、採用一個粗略的替代指標:訓練它所用的運算量。一條規則可能會說,例如,用超過某個極大運算次數訓練出來的模型就算前沿模型,並因此觸發額外的通報與測試。這條線確實粗糙,但它讓一個原本滑溜的類別有了可量測的把手。
這個詞之所以重要,是因為許多 AI 治理刻意走「窄」路線:與其去管制每一個試算表巨集和垃圾郵件過濾器,政策制定者試圖把監督集中在那寥寥幾個、能力強到足以造成大規模危害的系統上。代價則是:前沿一直在移動。今天的前沿模型就是明年的尋常工具,而一個聰明的方法可能用遠低於門檻假設的算力,就達到前沿等級的能力,因此任何固定的定義,都有對著「昨天的危險」開槍的風險。
某實驗室發表一個新的通用模型,它在程式設計、推理與科學任務上的得分超越所有前代,還能協助規劃網路攻擊;監管者把它歸類為前沿模型,並要求在公開釋出前提供其危險能力測試結果。
前沿模型是能力與不確定性都最高的地方,因此吸引了最多的安全關注。
算力門檻是一個方便的法律把手,而不是危險程度的量尺。一個小型、針對性訓練的模型,在某項任務上可能比一個龐大的通用模型更危險,因此「前沿」追蹤的是通用能力,而非每一種情況下的風險。
又稱
另見