大型語言模型代理與工具使用
ReAct 提示(ReAct prompting)
ReAct 是「Reason + Act(推理+行動)」的縮寫,是一個讓代理在每個動作之間把想法說出來的簡單模式。模型不是悄悄地跳到工具呼叫,而是先寫下一小段「我想做什麼」的思考,接著採取一個動作,再把結果讀成一則觀察,然後再思考一次。這段看得見的推理,讓下一步始終扣著剛剛發生的事。
具體而言,迴圈循環三種步驟:思考(Thought,自由形式的推理)、行動(Action,帶輸入的工具呼叫)、觀察(Observation,工具回傳的結果),如此重複,直到模型寫出最終答案。把它們交錯——而不是一開始就把所有事規劃好——讓代理能在真實結果到來時隨之調整,而那正是僵硬的預先計畫最容易崩壞的時候。
ReAct 之所以有影響力,是因為它幾乎免費:不需要額外訓練,只要一個提示結構。它的弱點在於那些「思考」仍然是生成出來的文字,可能很有自信卻是錯的,所以這段推理軌跡解釋了代理做了什麼,卻不能證明它做得對。
又称
另见