代理式人工智慧與工具使用
自洽性解碼(self-consistency)
自洽性解碼用「投票」取代貪婪的單路徑推理:對同一問題取樣多條獨立的思維鏈,再保留最多條思維鏈所同意的最終答案。其想法基於一個樸素觀察——困難問題通常有多條有效路徑通往唯一正確答案,但錯誤答案卻是各式各樣、彼此分散,因此正確答案往往是各樣本中的眾數。
具體做法是用溫度取樣解碼出 N 條推理路徑,從每條抽出最終答案,並對推理過程作邊際化——取多數答案,而非單一最可能的序列。這等於把思維鏈視為潛在變數並對其聚合,能降低任一條不走運推導所帶來的變異,相較單一貪婪鏈,在算術與多步推理基準上可穩定提升準確率。
此法只在答案夠可比、能夠計票時適用——例如數字或標籤這類簡短、可正規化的輸出——且成本隨樣本數 N 線性成長。它也會觸頂:一旦取樣讓真答案出現得夠頻繁而勝出,再增加樣本只徒增成本而無益準確率;對模型本就無解的問題,多數票也可能自信地錯。
\hat{y}=\arg\max_{y}\sum_{i=1}^{N}\mathbb{1}\!\left[a(r_i)=y\right],\qquad r_i\sim p_\theta(r\mid x)
取樣 N 條推理路徑 r_i,抽出各自答案 a(r_i),回傳多數答案 y。
自洽性是對推理路徑作邊際化以挑出答案;它並不會產出更好的單一解釋,且勝出的票數未必對應最連貫的那條思維鏈。
又稱
另見