評估與基準測試
基準飽和(benchmark saturation)
當最好的模型得分高到貼近天花板,以致再也分不出彼此時,基準就飽和了。如果三個模型分別拿 96、97、98 分,這些差距已落在雜訊與標錯題目的範圍內,基準就停止履行它的職責:為最前沿排名。剩下的進步空間,小到失去意義。
飽和一部分是成功——模型確實變強了——一部分是假象,因為簡單題目都被解掉、汙染又把分數灌高,而測試集裡殘留的任何錯誤都會壓住可達到的上限。無論如何,一個飽和的基準會給人錯覺,以為進步停滯,或以為兩個非常不同的模型其實相當。
領域的回應,是讓飽和的題組退役、打造更難的後繼者——更難的題目、更多選項、經對抗式篩選的題目、專家級或抗汙染的任務。這台跑步機永不停歇:今天不可能的基準,就是明年飽和的基準,所以評估必須持續把球門往後移,才能保持有資訊量。
又称
另见