安全、越獄與紅隊測試
危險能力評估(dangerous capability evaluation)
多數評估問的是「模型有多好」;危險能力評估(dangerous capability evaluation)問的是個更陰沉的問題:這個模型能幫一個人造成多大規模的傷害?它量度的是模型在「能力本身即風險」之領域的上限——設計生物或化學武器、進行攻擊性網路作戰、大規模說服與操弄,以及越來越受關注的「自主行動、自我複製、或在無人介入下取得資源」的能力。目的是在部署前預測最壞情況下的濫用,而非替日常的有用性打分。
關鍵的量度是「增益」(uplift):不是模型能不能背出已知事實,而是它把一個現實行為者的能力,從他「靠搜尋引擎與圖書館本就具備」的基準線抬高了多少。所以評估是針對「拿掉安全防護的未過濾模型」、並施以強力誘出(elicitation)——專家提示、工具、微調、鷹架(scaffolding)——來進行,正是為了找出真正的能力、而非打磨過的預設值;而評分由能分辨「真正可操作的指引」與「聽起來合理的文字」的領域專家來做。
這些評估本身既敏感又不完美。探測生物武器或網路增益,意味著去生成「你最想封堵的那種內容」,所以這項工作是在存取控管下進行的;而一項通過的評估,只在「所施加的誘出工夫」範圍內令人安心,因為一個更聰明的提示、或未來的一次微調,可能解鎖更多。它們如今是前沿安全政策的技術骨幹——那些政策把特定的能力門檻,綁定到「模型可發布前所需的防護措施」上。
又稱
另見