能力與推理
推理對比記憶(reasoning vs. memorization)
當模型攻克一道難題時,有兩種截然不同的解釋,而把它們分辨開來,是這個領域的核心謎題之一。它是推理了嗎——從原理出發、推到一個在真正全新案例上也能達到的答案?還是它記憶了——曾在龐大的訓練資料某處見過那道一模一樣的題、或它的近乎雙胞胎,只是把答案回憶出來?從外面看兩者都像成功,但唯有前者能在它從未遇過的全新變化下倖存。
這之所以要緊,是因為基準測驗可能被悄悄汙染:若測驗題洩漏進了訓練集,高分量到的是回憶、而非推理,會高估模型真正的本事。研究者用擾動題目來探查這道差別——改數字、給角色換名、變動表面卻保留邏輯,再看表現是守得住還是崩塌。一個只會記憶的模型會在轉折處絆倒;一個真正推理的則一路順航。現實中模型兩者並行,能靠回憶時就靠回憶、必須推理時才推理,這正是乾淨評估如此困難的原因。
同樣的高分,可能源於理解,也可能源於資料外洩。永遠要問:這道測驗在訓練時有沒有可能被看過。
又稱
另見