安全、越獄與紅隊測試
前沿模型安全政策(frontier model safety policies)
當最有能力的模型開始顯露出「確實危險之能力」的早期跡象,領先的開發者發布了一些框架,承諾依風險高低採取特定的防護措施。這個共同的點子——有時稱為「負責任擴展政策」(responsible scaling policy),有時稱為「整備框架」(preparedness framework)——是事先定義能力門檻,例如「實質提升一個非專家走向生物武器的能力」或「自主自我複製」,並承諾:在模型越過那條線之前,必須先備妥界定好的安全、部署與監督措施,若未備妥就暫停開發。
這些政策把安全從一種「感覺」變成一套「程序」。它們明定要跑哪些危險能力評估、多久跑一次,每個風險級別觸發哪些防護(從輸出過濾,一路到限制存取與強化的模型權重安全)、發布前誰必須簽核,以及評估結果落入危險區時會怎麼辦。許多政策也承諾外部紅隊測試、第三方稽核、事故通報與知會政府——把內部的謹慎,轉化為可問責、可查核的承諾。
它們是有意義的一步,卻不是保證。門檻與測試都很新,可能抓不到真正的風險;這些政策大致是自我加諸、自我評分的,執行不均,又有競爭的長期壓力;而一個承諾的好壞,端看一家公司是否真的願意暫停。它們最好被讀成一個正在成形的治理鷹架——與餵養它們的危險能力評估緊密相連,並越來越與正式的 AI 法規(regulation)交纏——而非前沿風險的完成解答。
又称
另见