評估與基準測試

長脈絡基準測試(long-context benchmarks)

這類基準檢驗一個號稱能讀十萬字的模型,是否真的用得上全部內容,而不只是開頭與結尾。最簡單的探針是「大海撈針」:把一個特定事實藏在巨大文件的某處,要模型把它找出來。把這根針掃過每個位置、每種輸入長度,你就得到一張熱度圖,顯示模型真正注意之處與它悄悄遺忘之處。

更難的版本超越單一事實的查找:必須整合的多根針、需要跨越文本遙遠段落來推理的問題,或追蹤一個在長篇故事中不斷變化的變數。這些都揭露了:規格表上的大脈絡視窗,不等於對它的有效運用。

反覆出現的發現是一種「迷失於中段」的模式:模型能可靠地回想長輸入最前與最後的資訊,到了中間卻變得不可靠,而且準確率隨輸入變長而衰退。所以長脈絡基準量的不只是模型能否接受長提示,而是它真正的理解力在整個跨度上撐得有多優雅。

又稱
needle-in-a-haystacklong-input evaluation