評估與基準測試

推理基準測試(reasoning benchmarks)

推理基準測試檢驗模型能不能一步步把問題想通,而不只是背出一個事實。經典例子是小學應用題(GSM8K)與競賽數學(MATH),答案是一個明確的數字,沒法蒙混——多步推理鏈要嘛落在正確數值上,要嘛沒有。較新的題組則推進到邏輯謎題、科學問題,以及刻意設計來抵抗死記的研究所級難題。

由於最終答案可被核對,評分大多仍能自動進行,而這類基準也揭露了一件重要的事:提示模型把過程一步步寫出來,往往能大幅提升準確率。這個觀察,使推理基準成為思維鏈(chain-of-thought),以及近期一波「先思考更久再作答」的模型的試煉場。

兩個誠實的提醒。第一,正確的最終數字可能掩蓋一條矇對的錯誤推理鏈,所以頭條準確率會高估真正的推理能力。第二,一套數學題一旦被廣泛使用,它的題目與解答就會淹沒網路、被背下來,這正是最難的現代題組要保持新鮮、私有或經過汙染檢查的原因。

又称
math benchmarksGSM8KMATH