評測、紅隊與穩健性

能力引出問題

假設你給某人出一份測驗,他考了 60%。這代表他只懂 60% 的內容嗎——還是他累了、看錯了題目說明,或根本沒認真作答?對 AI 模型來說,這個疑問更尖銳:模型測出來的表現,極度取決於你怎麼問。能力引出問題(the elicitation problem)就是這個難題:要確定一次測試真的把模型「真實、最佳」的能力引了出來,而不是因為提示或設置太弱所造成的某個偏低數字,其實很難。

要好好把能力引出來,可能需要真功夫:更好措辭的提示、讓模型一步步思考、給它工具或多次嘗試,或用少數幾個範例微調它,都可能大幅拉高它的分數——有時甚至把看似的「做不到」變成清楚的「做得到」。這意味著多數評測量到的是一個下限:「這個模型至少能做到這麼多。」真正的上限可能更高,而我們往往無法確信自己已經觸及它,對於新穎或複雜的任務尤其如此。

能力引出問題是安全評測的致命弱點。如果我們下結論說某個模型缺乏某項危險能力,我們就得擔心:會不會只是我們沒能把它引出來——而一個更高明的使用者,或日後配上更好鷹架的模型本身,可能就會在我們的測試失手之處成功。當它和故意藏拙結合時最為驚人:一個有能力的模型可能故意表現不佳。正因如此,謹慎的評測者會對「做不到」的結果抱持戒心,並大力投資於盡可能用力地把能力引出來。

一個模型用樸素的提示在推理測驗上考了 30%;加上「一步步想」、給它一張草稿紙、並允許三次嘗試後,分數升到 75%——所以原本那個 30% 嚴重低估了這個模型能做到的事。

一個模型「能做什麼」有一部分是個測量問題:薄弱的引出方式會把真實能力藏起來。

由於能力引出很難,多數評測分數都是下限,而非精確的度量——「做不到 X」的結果,可能只是「我們沒能把 X 從它身上弄出來」。這在與故意藏拙(模型刻意表現不佳)結合時最為危險。

又称
elicitation能力引出