JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

治理前沿風險

從單一攻擊拉遠到決定「一個模型是否安全到足以發布」的政策——以及整套堆疊如何彼此咬合。

從逐一防禦到發布決策

前四篇是用顯微鏡看單一的攻擊與防禦。現在拉遠。隨著模型愈來愈強,關鍵問題不再是「我們補掉這個越獄了嗎?」,而是「這個模型整體而言,是否安全到足以向世界發布——若否,要先滿足什麼條件?」回答這個問題需要的不只是工程,而是政策:把量測到的能力連結到所需保障措施的、成文且公開的承諾。

随着模型规模扩大,能力可预测地提升——正是这一趋势把“我们修好这个越狱了吗?”变成了“它究竟能不能安全发布?”。

对数坐标曲线:随着模型与数据规模增长,损失稳步下降。

前沿安全政策:若—則承諾

領先的實驗室如今會公布前沿模型安全政策(frontier model safety policies)——名稱諸如「負責任擴展政策」、「整備框架」或「前沿安全框架」。儘管品牌名各異,它們共用一副骨架:界定能力門檻(模型可能跨越的紅線)、把每道門檻綁定到跨越它之前就必須到位的所需保障措施,並承諾在保障措施尚未就緒時暫停或限制。這是一種若—則結構:模型展現出超過某等級的危險能力,一組指定的安全、部署與監督措施就成為強制。

  1. 量測——以危險能力評估紅隊測試,標定模型相對於各門檻的位置。
  2. 讓保障措施對應能力——能力愈高,就觸發愈強的權重安全防護、愈緊的部署管控,以及愈重的監控。
  3. 把關發布——若所需保障措施未達標,模型就不以完整能力上線,沒有例外。
  4. 持續檢討——隨著理解的進步與前沿的推移,門檻與評估也要被修訂。
把“如果—就”承诺看作一个生命周期:测量能力、匹配防护措施、把控发布,再随阈值与模型变化持续复审。

带有监控与更新反馈回路的循环式流水线。

為什麼這很難拿捏

這些政策是實實在在的進步,但也要誠實面對其侷限。能力門檻是建立在模糊科學上的判斷——我們還無法精確量測「實質提升」。評估本身可能被操弄、或單純漏看某項能力,而每項技能的雙重用途本質,意味著安全與不安全之間鮮少存在一條乾淨的界線。還有競爭的拉力:一家把關嚴格、而對手不嚴的實驗室要付出代價,這正是為何許多框架仰賴外部驗證、第三方評估,以及監管的前景,來讓承諾保持可信。

整套堆疊,一圖以蔽之

把這五篇退一步看,各層便對齊了。在行為層,安全微調拒答形塑模型想做什麼。在執行層,防護欄內容審核與系統提示把它包起來。在攻擊層,越獄注入投毒後門四處探縫。在保證層,紅隊測試能力評估量測剩下的風險。而在治理層,前沿政策決定什麼能上線。沒有任何一層是充分的;它們合起來,才使大型語言模型安全成為一門持續移動、縱深防禦的實務,而非一個已被解決的問題。

P(\text{breach}) = \prod_{i=1}^{n} p_i

把纵深防御量化:攻击只有穿过每一层才能得手,所以被攻破的概率是各层放行概率之乘积。