智能體與前沿

ReAct模式(ReAct pattern)

/ ree-AKT PAT-urn /

ReAct是一份簡單的配方,讓AI智能體在行動前先把想法說出來,等看到結果後再接著想。這名字是「Reason+Act」(推理+行動)的縮寫。模型不直接跳到動作,而是交替進行:一段思考(「我得查出這部電影是誰導演的,那就該搜一下」)、一個動作(搜尋這部電影)、一條觀察(搜到的結果)。然後它根據剛學到的東西再想一遍,循環繼續,直到它能給出最終答案。

這個洞見出自2022年的一篇研究論文:把推理和真實動作交錯進行,比單用其中任何一種都更好。純推理會讓模型自說自話,得出一個自信卻錯誤、又無從核對的答案;純動作——不加反思地呼叫工具——則讓它沒有計劃地亂抓一氣。把兩者編織在一起,意味著每個動作都立足於一條說明了的理由,而世界給出的每條新事實,又能糾正下一個念頭。那些寫出來的思考,還讓人類讀懂、除錯智能體的行為變得容易得多。

要說清楚ReAct是什麼、不是什麼。它是一種提示與編排的模式,不是一種新模型,也不保證正確——所謂「推理」依然是模型在生成看似合理的文字,可能是錯的,甚至是事後編出來的。它可能無限循環、反覆重試同一個失敗的動作、或一路推理進死胡同。它之所以有用,是因為加進了結構和來自現實的反饋,而不是因為它讓模型真正理解了什麼;請把那些可見的「思考」當作一份有用的軌跡,而不是智能體「心裡有數」的證據。

問題:「2016年奧運會舉辦城市的人口是多少?」思考:我得先知道主辦城市。動作:search(「2016年奧運會主辦城市」)。觀察:里約熱內盧。思考:現在要查里約的人口。動作:search(「里約熱內盧人口」)。觀察:約670萬。思考:我有答案了。最終答案:約670萬。

思考→動作→觀察,循環往復:推理與行動互相餵養。

寫出來的那段「思考」,是模型生成的一段說辭,並不是窺見某個真實推理過程的窗口。它常能提升表現、也很利於除錯,但一段流暢、看上去合情合理的思考,照樣可能跟著一個錯誤的動作——千萬別把這段旁白當成保證。

又稱
ReActreason and actreasoning + acting推理-行动模式推理-行動模式