代理式人工智慧與工具使用

思維樹(ToT)

思維樹把解題視為對「部分解」的刻意搜尋,而不是一條由左到右、一氣呵成的喃喃自語。模型從當前狀態提出數個可能的下一推理步驟,評估每一步看起來有多有希望,展開好的分支,並能回溯放棄死路。這就像「寫下腦中第一個想到的解法」與「先勾勒幾種開局、加以評估、再投入最強的一種」之間的差別。

具體而言,一個「想法」是一個中間步驟;狀態則是想法的序列,構成樹上的節點。生成器 G(s) 取樣 k 個候選的下一想法,評估器 V(s) 給每個狀態一個啟發式價值——可用直接提示(請替這個狀態打 1 到 10 分)或對多個樣本投票——再由廣度優先或帶剪枝的深度優先等搜尋策略探索邊界。語言模型因此同時扮演三種角色:提出走步、評判走步,並受搜尋控制器驅動。

在具備分支選擇與可驗證子目標的謎題上(例如 24 點或填字遊戲),前瞻與回溯確實帶來可量測的幫助。代價是每題需要多得多的模型呼叫,且評估器可能校準不良,導致搜尋自信地展開錯誤分支;在單一連貫思維鏈本就足夠的任務上,增益會明顯縮小。

s^{*}=\arg\max_{s'\in G(s)} V(s'),\qquad G(s)\ \text{samples }k\text{ thoughts},\ V(s')\in[0,1]

在每個節點,控制器展開價值最高的候選想法;其餘則交由剪枝與回溯處理。

ToT 的優勢來自評估器:搜尋樹的好壞取決於引導它的價值估計,因此自我評估太弱時,ToT 會退化回昂貴的隨機取樣。

又稱
ToT思維樹