評估、基準測試與紅隊測試

長脈絡評估(long-context evaluation)

宣傳一個百萬詞元的脈絡視窗很容易;忠實地用上它則不然。長脈絡評估問的是:模型能否真正在很長輸入的深處找出並推理那裡的資訊,而不只是注意開頭與結尾。標準的探針是大海撈針:把一個特定事實(針)藏在很長的干擾文本(草堆)裡受控的深度,測試精確檢索。

變動針的深度與總長度,掃出一張二維的檢索準確率熱圖,通常會暴露一個迷失於中段的山谷——放在中央區域的事實準確率下滑。由於單針檢索對當前模型太簡單,更難的套件提高門檻:多針與多跳檢索、跨眾多位置的彙總,以及像 RULER、LongBench 與 infinity-Bench 這類要求綜合分散證據而非複製單一片段的推理基準。

有效脈絡長度——表現仍可靠的那個長度——通常遠短於宣傳的最大值,而合成的撈針測試會高估真實能力,因為一句明顯格格不入的句子不自然地容易被認出。真正的長文件推理,也就是相關證據融入周遭文字之處,仍遠比那個招牌視窗所暗示的更難。

宣傳的脈絡視窗是一種容量,而非保證——以多針與中段位置任務上的退化來量測的有效脈絡長度,才是要緊的數字。

又稱
needle in a haystack長上下文評估大海撈針測試