從逐一防禦到發布決策
前四篇是用顯微鏡看單一的攻擊與防禦。現在拉遠。隨著模型愈來愈強,關鍵問題不再是「我們補掉這個越獄了嗎?」,而是「這個模型整體而言,是否安全到足以向世界發布——若否,要先滿足什麼條件?」回答這個問題需要的不只是工程,而是政策:把量測到的能力連結到所需保障措施的、成文且公開的承諾。
對數座標曲線:隨著模型與資料規模增長,損失穩步下降。
前沿安全政策:若—則承諾
領先的實驗室如今會公布前沿模型安全政策(frontier model safety policies)——名稱諸如「負責任擴展政策」、「整備框架」或「前沿安全框架」。儘管品牌名各異,它們共用一副骨架:界定能力門檻(模型可能跨越的紅線)、把每道門檻綁定到跨越它之前就必須到位的所需保障措施,並承諾在保障措施尚未就緒時暫停或限制。這是一種若—則結構:若模型展現出超過某等級的危險能力,則一組指定的安全、部署與監督措施就成為強制。
- 量測——以危險能力評估與紅隊測試,標定模型相對於各門檻的位置。
- 讓保障措施對應能力——能力愈高,就觸發愈強的權重安全防護、愈緊的部署管控,以及愈重的監控。
- 把關發布——若所需保障措施未達標,模型就不以完整能力上線,沒有例外。
- 持續檢討——隨著理解的進步與前沿的推移,門檻與評估也要被修訂。
帶有監控與更新回饋迴路的循環式流水線。
為什麼這很難拿捏
這些政策是實實在在的進步,但也要誠實面對其侷限。能力門檻是建立在模糊科學上的判斷——我們還無法精確量測「實質提升」。評估本身可能被操弄、或單純漏看某項能力,而每項技能的雙重用途本質,意味著安全與不安全之間鮮少存在一條乾淨的界線。還有競爭的拉力:一家把關嚴格、而對手不嚴的實驗室要付出代價,這正是為何許多框架仰賴外部驗證、第三方評估,以及監管的前景,來讓承諾保持可信。
整套堆疊,一圖以蔽之
把這五篇退一步看,各層便對齊了。在行為層,安全微調與拒答形塑模型想做什麼。在執行層,防護欄、內容審核與系統提示把它包起來。在攻擊層,越獄、注入、投毒與後門四處探縫。在保證層,紅隊測試與能力評估量測剩下的風險。而在治理層,前沿政策決定什麼能上線。沒有任何一層是充分的;它們合起來,才使大型語言模型安全成為一門持續移動、縱深防禦的實務,而非一個已被解決的問題。
把縱深防禦量化:攻擊只有穿過每一層才能得手,所以被攻破的機率是各層放行機率之乘積。