規模法則與湧現
推論與訓練的規模權衡(scaling inference vs. training)
你有一份預算和一個目標:更好的答案。兩根截然不同的槓桿都能交出它。第一根,擴大訓練——蓋更大的模型或餵它更多,讓它一開口就更聰明。第二根,擴大推論——模型維持原樣,但讓它對每道題想得更久。在兩者之間做選擇,是現代大型語言模型核心的工程取捨之一。
訓練算力只花一次,再攤提到未來每一次查詢上;推論算力卻在每一次呼叫上重新再花一遍。所以該選哪根槓桿,取決於流量與難度。對一個服務龐大流量的模型來說,較小但想更久的配置只在某個程度內整體更便宜——沉重的逐次思考終究會比把能力直接燒進模型還貴。對罕見而極難的問題,讓一個中等模型細想則是筆划算交易。近期結果顯示測試時算力可以替代參數,但並非毫無上限,而且這個兌換率會隨任務類型而變。
這並不是二選一。前沿越來越把兩者結合——先訓練一個有實力的基底,再在推論時擴大它的思考——而那個最優的分配本身,就是一個開放、正被積極研究的規模問題。
另見