大型語言模型代理與工具使用

自我反思(self-reflection)

人很少交出第一版草稿——我們會重讀、找出薄弱的地方、再修掉。會自我反思的代理也一樣:產出答案或採取行動後,它停下來批評自己的輸出,問哪裡出了錯、哪裡能更好,再用這份批評去修訂。第一次嘗試成了草稿,而不是定論。

就機制而言,它是疊在工作之上的一個額外迴圈:先生成、再評估、再改進。評估可以是模型拿自己對照目標來評判,也可以扎根在某個外部的東西上——一個失敗的測試、一則工具錯誤、一張檢查清單——而這往往比純粹的自我評判更有效。批評會被回饋進提示,讓下一次嘗試能對症處理找到的具體缺陷。

當有一個真實的訊號可以反思時——例如一個失敗的單元測試,或一個不符規格的輸出——反思是真的有幫助。它的極限在於:一個模型批評自己,會共用自己的盲點,所以它可能很有自信地宣稱一個錯誤答案「看起來沒問題」——反思能改善品質,但不能保證品質。

又称
self-critiqueself-refinement