評測、紅隊與穩健性
能力評測
在你雇用一個人或信任一項工具之前,你會想知道它實際上能做什麼——這個人會不會寫程式?這台計算機能不能處理很大的數字?AI 系統也類似,但更難判斷,因為單一一個模型幾乎能嘗試你用文字交付的任何任務,而它的能力並沒有寫在任何地方——那是從訓練中浮現出來的。能力評測(capability evaluation)就是一種結構化的測試,用來衡量一個 AI 模型能做什麼:不是它善不善良或安不安全,而是它在某項任務上有多在行。
實務上,一次評測就是一組任務,外加一套替答案打分的方法——例如數千道考試式題目、附自動檢查的程式設計題,或在模擬環境中的多步驟任務。研究者讓模型去做這些任務,並記錄分數(比方說「解出其中 62% 的程式題」)。好的能力評測會盡力讓模型發揮到最好——給它工具、給它多次嘗試、用精心設計的提示——因為目標是找出模型能力的「上限」,而不是一個敷衍的下限。
能力評測是許多 AI 安全工作的基礎:在你知道一個模型能做什麼之前,你無法判斷它是否危險。但測出來的分數只是真實能力的「下限」——更好的提示、更多次嘗試,或微調,都可能揭露出測試漏掉的能力(這就是能力引出問題)。如果測驗題目洩漏進了訓練資料(基準測試污染),分數還會被灌水。所以一個能力數字雖有參考價值,但應讀作「至少有這麼強」,而不是「恰好這麼強」。
一個由競賽等級數學題組成的基準測試回報某模型解出其中 40%;改用更好的提示、並讓它能使用計算機工具後,同一個模型解出了 65%——顯示測出來的數字有多麼取決於你多努力把這項本事引出來。
能力分數衡量的是你「設法從模型身上取得」的東西,這可能遠低於它真正的上限。
能力評測衡量的是本事,不是安全:一個模型可以考得很漂亮卻仍然不安全,而高分最好讀作真實能力的下限,而非精確的度量。
又稱
另見