ReAct模式(ReAct pattern)
/ ree-AKT PAT-urn /
ReAct是一份简单的配方,让AI智能体在行动前先把想法说出来,等看到结果后再接着想。这名字是「Reason+Act」(推理+行动)的缩写。模型不直接跳到动作,而是交替进行:一段思考(「我得查出这部电影是谁导演的,那就该搜一下」)、一个动作(搜索这部电影)、一条观察(搜到的结果)。然后它根据刚学到的东西再想一遍,循环继续,直到它能给出最终答案。
这个洞见出自2022年的一篇研究论文:把推理和真实动作交错进行,比单用其中任何一种都更好。纯推理会让模型自说自话,得出一个自信却错误、又无从核对的答案;纯动作——不加反思地调用工具——则让它没有计划地乱抓一气。把两者编织在一起,意味着每个动作都立足于一条说明了的理由,而世界给出的每条新事实,又能纠正下一个念头。那些写出来的思考,还让人类读懂、调试智能体的行为变得容易得多。
要说清楚ReAct是什么、不是什么。它是一种提示与编排的模式,不是一种新模型,也不保证正确——所谓「推理」依然是模型在生成看似合理的文字,可能是错的,甚至是事后编出来的。它可能无限循环、反复重试同一个失败的动作、或一路推理进死胡同。它之所以有用,是因为加进了结构和来自现实的反馈,而不是因为它让模型真正理解了什么;请把那些可见的「思考」当作一份有用的轨迹,而不是智能体「心里有数」的证据。
问题:「2016年奥运会举办城市的人口是多少?」思考:我得先知道主办城市。动作:search(「2016年奥运会主办城市」)。观察:里约热内卢。思考:现在要查里约的人口。动作:search(「里约热内卢人口」)。观察:约670万。思考:我有答案了。最终答案:约670万。
思考→动作→观察,循环往复:推理与行动互相喂养。
写出来的那段「思考」,是模型生成的一段说辞,并不是窥见某个真实推理过程的窗口。它常能提升表现、也很利于调试,但一段流畅、看上去合情合理的思考,照样可能跟着一个错误的动作——千万别把这段旁白当成保证。