能力與推理

推論時搜尋(inference-time search)

推論時搜尋的意思是:生成多個候選答案再從中挑選,而不是信任第一次嘗試。因為取樣帶有隨機性,同一題問上幾次會得到不同的推理思路;即使多數錯了,仍有些會落在正確答案上。最簡單的形式是「N選優」(best-of-N):產出 N 個解答,再保留最好的一個,靠多數表決、靠一個評分模型,或在任務允許時靠精確核對(例如執行生成的程式碼)來判定。

更精細的形式會像西洋棋引擎搜尋棋步那樣,搜尋推理路徑的空間:在有希望的步驟分岔,剪掉走死的枝,只培養看起來強的線路,有時還由一個為部分進度評分的價值模型引導。好處是許多淺嘗的嘗試能合力攻破單次嘗試無法解開的問題。代價是運算倍增,還有一個微妙的陷阱:若你挑選贏家的方式不可靠,搜尋可能自信地把一個碰巧很熱門的錯誤答案推到檯面上。

又称
best-of-Nsearch over candidates