代理式人工智慧與工具使用

Reflexion(語言式強化學習)

Reflexion 讓代理在反覆嘗試中變強,靠的不是更新權重,而是讓它用文字寫下「哪裡出了錯、下次該怎麼做更好」,再把這些筆記留作下一次嘗試的記憶。一次失敗的回合後,代理對整段軌跡進行反思、產出一條語言式的教訓,下一次嘗試時便把這條教訓當成上下文的一部分讀回來。這是靠寫日記、而非靠梯度下降,從錯誤中學習。

這個迴圈把獎勵訊號重新表述為語言。代理行動並接收回饋——任務成敗、測試結果或環境獎勵——接著一個自我反思步驟,把該訊號轉成一段簡潔的自然語言批評,存進情節記憶緩衝區。在後續試驗中,這份反思記憶會被前置到提示,引導行為遠離先前的失敗。由於模型參數凍結,試驗之間唯一改變的就是累積的文字,相較微調,這既快速、便宜又可解釋。

在「允許多次嘗試且有明確結果訊號」的任務上(程式撰寫、決策與推理基準),Reflexion 能顯著提高成功率,但它取決於能否取得一個有資訊量的成敗以供反思,以及模型是否寫得出真正有用、而非僅止於貌似合理的反思。它無法像權重更新那樣把學習遷移到不相關的任務,因為那些教訓只活在該回合的記憶裡。

Reflexion 把教訓以文字存於情節記憶、而非權重,因此其增益僅限於該任務,記憶一旦清除便消失。

又稱
Reflexionverbal RL語言式強化學習