規模法則與湧現

推論算力擴展(inference-compute scaling)

直到不久前,幾乎所有算力都投在訓練上;回答時,模型只做一次快速的前向傳遞就開口。推論算力擴展把注意力翻到另一端:讓模型在回答時多花點力氣——想久一點、草擬好幾種嘗試、檢查自己的作答——答案的品質就會往上爬。這就像脫口而出第一個念頭和真的把一道題算出來之間的差別。

具體的形式包括長串的思維鏈推理、取樣許多候選解再投票或挑最佳、以及把步驟展開成樹再剪枝的搜尋程序。經驗上,當你在測試時投入更多算力,困難推理任務的正確率會平滑地上升——這是它自己的一條規模曲線,獨立於訓練法則之外。一個被允許多想的中等模型,可以匹敵一個瞬間作答的大上許多的模型,這重塑了算力該花在哪裡才划算。

這些增益是真的,但有上限且不均勻:多想對有可驗證結構的問題的幫助,遠大於對開放式問題;而且它是在每一次查詢上、而非只在訓練時一次,付出延遲與成本的代價。

又稱
test-time compute scalingtest-time scaling