能力與推理
測試時運算(test-time compute)
測試時運算的想法是:模型能在你提問當下被允許更費力地工作,從而給出更好的答案,而不必靠把模型做得更大或重新訓練。給它更大的思考預算、更多空間寫出推理、嘗試幾種做法、檢查自己的答案,難題上的正確率往往就會上升。這是機器版的「考試給五分鐘還是給一小時」:同一個學生,多點時間,考卷更好。
這之所以重要,是因為它在模型大小之外又多出一個旋鈕。多年來,改善模型的主要方法是擴大訓練、增加參數與資料。測試時運算則讓你能按需用額外的推論力氣換取品質,一題一題地分配:簡單題少花,難得一見的難題多花。代價是真實的,因為想得更多就意味著更多詞元、更多花費、更多等待,而報酬最終會趨於平緩;所以實務上的功夫,是把預算配得上這道題值得花的力氣。
\text{accuracy} \;\approx\; f(\text{model size},\; \text{compute spent per question})
品質如今取決於兩個旋鈕:模型多大,以及它在作答時被允許思考多少。
又称
另见