JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

泛化、極限,與誠實地衡量推理

高手的問題:模型是在推理,還是在回憶背過的模式?能力如何泛化、在哪裡崩潰,以及如何在不自欺的前提下評估推理。

把能力組合成新的能力

推理的夢想是「重用」:精通兩種能力,然後在一個同時需要兩者的問題上把它們結合起來。這就是組合式泛化(compositional generalization)——處理熟悉零件的新穎組合,例如在一道模型從沒見過這個確切樣貌的多步驟應用題之中套用一次單位換算。當它行得通,模型感覺是真的有智慧;當它失敗,你看到的是一個各部分單獨都滿分、卻無法把它們鎖在一起的模型。

組合式泛化也是檢驗一項湧現能力究竟是真正的理解、還是背下來的捷徑時,最清楚的試金石。記憶能應付它見過的情況;組合則能應付沒有人可能事先存好的情況。

记忆捷径与真正理解之别:过拟合的模型能应付见过的样例,却在新组合上失败;而拟合良好的模型能泛化——这正是组合泛化的核心。

三幅小图:欠拟合的模型、能泛化的良好拟合模型,以及记住训练点的过拟合模型。

對他人心智的推理

一項微妙且爭議很多的能力是心智理論(theory of mind):推理另一個主體知道什麼、相信什麼、意圖什麼——包括錯誤信念,例如「Sally 以為球在籃子裡,但球被偷偷移走了」。強大的模型常能通過這類測試,這對必須追蹤使用者已知什麼、或故事角色會預期什麼的助理來說很重要。

推理還是回憶?污染的陷阱

每一個能力主張,都會撞上推理 vs 記憶的問題,而實務上的危險是基準污染(benchmark contamination):如果一份測驗的題目與答案外洩進了訓練資料,高分衡量的就是回憶,而非推理。一個「解開」某套著名謎題的模型,可能只是讀過了解答。這會悄悄地灌水分數,也是人們高估模型推理能力最常見的單一原因。

好的推理基準(reasoning benchmarks)會反擊:保留不公開或全新撰寫的題目、私有測試集,以及由模板生成、讓每個實例都是新的的任務。推理最有力的證據,是在那些可以證明不可能被背下來的問題上的表現。

强健的推理基准会把测试题保留为留出且私有的集合,这样被污染的训练集就无法虚高分数。

数据被划分为相互独立的训练、验证和测试三部分。

它在哪裡崩潰

一張誠實的能力地圖要包含它的邊緣。常見的推理失誤(reasoning failures)包括:信心十足卻算錯的算術、看似合理但某一步無效的證明、對表面改寫的脆弱、在長脈絡中跟丟線索,以及只去模式比對問題外觀而非其邏輯的「捷徑」答案。這些都不代表推理是假的——它們代表推理並不均勻,而這種不均勻可預測到足以讓你預先規劃應對。

  1. 用改寫和全新的數字去探測,而不只用標準問法,以區分推理與回憶。
  2. 在困難題目上強制顯示工作過程,讓失誤可被診斷,而非被藏起來。
  3. 用獨立的檢查驗證最終答案——執行程式、重算一次,或反問。
  4. 偏好保留不公開或私有的任務;把任何公開基準分數都當成可能被污染的上限。