能力與推理
推理模型(reasoning models)
推理模型是經過訓練、會先思考再開口的模型,它先產出一大段內部演算,最後才給出簡潔答案。對一般模型,你得用提示把分步思考哄出來;推理模型則把這習慣內建好了,思考過程可長達數千個詞元,邊探索、邊回溯、邊複查,才最終定案。看得見的回覆通常很短,但背後有一份龐大的隱藏草稿,扛起了抵達答案的重活。
這類模型通常的做法,是拿一個有實力的基礎模型,再用訓練(常是強化學習)讓它在長篇思辨能在有可核對解答的問題上(如數學與程式碼)導向正確答案時獲得獎勵。經過多輪,模型學會了有回報的習慣:分情況討論、檢驗自己的主張、發現矛盾就修正。代價清楚地寫在帳單與時鐘上:每個答案花費的運算與等待都高出許多,所以推理模型在真正困難的問題上才划得來,用在簡單問題上則是殺雞用牛刀。
那段長思考是推論過程的一部分,不是另一個模型。你付的是答案之前多生成的詞元,而非一個更聰明的網路。
又称
另见