評估與基準測試
能力評估與安全評估(capability vs. safety evaluation)
能力評估問的是模型「能做什麼」——解數學、寫程式、回答問題——而你希望這些分數高。安全評估問的是模型「可能做出什麼有害的事」——產出危險指示、欺騙、外洩隱私資料、屈服於越獄——而你希望這些分數低。它們是不同的問題,需要不同的測試,而一個模型可能在其中一項表現傑出,在另一項卻令人擔憂。
這兩者以一種令人不安的方式糾纏:能力上升,風險往往也上升。一個好到能寫出有用程式碼的模型,也好到能寫出惡意軟體;一個推理良好的模型,能推理出繞過防護欄的辦法。所以你無法從能力基準讀出安全,而一方的進步並不保證另一方的進步。安全評估也更倚重對抗式測試——紅隊演練、越獄題組、探測欺騙——因為你在尋找罕見的最壞情況,而非平均表現。
成熟的評估會把兩者並排呈現,並抗拒把它們塌縮成單一頭條。一個能力高分、安全輪廓卻未經量測的模型,並不是綠燈;負責任的問題不只是「它有多好」,而是「它有多好,以及它可能怎麼出錯」。
又称
另见