安全、越獄與紅隊測試

兩用風險(dual-use risks)

兩用(dual-use)指的是「因同一個理由而既有價值、又危險」的能力。一個把生物化學解釋得好到能加速藥物發現的模型,正因如此,也更會解釋如何合成毒素;一個能找出資安漏洞、好讓防守方修補的模型,同樣能幫攻擊方利用它;流暢而具說服力的寫作,既協助一場公共衛生宣導,也協助一場假訊息作戰。有害用途不是一個你能直接刪掉的獨立功能——它就是「那個有用的能力」指向了更壞的方向。

這正是為什麼大型語言模型安全無法化約成一張「禁止輸出」清單。化學家正當需要的知識,與壞行為者想要的知識,大幅重疊,所以對整個領域一律拒絕會摧毀龐大的價值,而放任的回答又冒著替罕見危險使用者「增益」的風險。判斷因此轉移到「意圖與脈絡」(模型只能從文字推測),以及「模型比起唾手可得的來源到底多加了多少」,而非抽象地看主題本身。

因為你無法在不癱瘓益處的前提下把危險工程掉,兩用是被「管理」而非被「解決」的。工具箱是分層的:分級存取,讓高風險能力只到達經審核的使用者;對最具操作性的細節設輸出限制;監測濫用模式;對敏感 API 做「認識你的客戶」(KYC)控管;以及用能力評估去決定某個模型的威力值得多少摩擦。誠實的框架是「在不確定下做風險—效益權衡」,而非「消除」。

若一項能力的益處與害處共用一個根,你就無法在不切除益處的情況下刪掉害處——這正是為什麼兩用問題逼出的是存取政策,而不只是拒絕。

又稱
dual-use dilemmabeneficial-harmful capability overlap