代理式人工智慧與工具使用
自我反思代理
自我反思代理先產生一個答案,再把注意力轉回那個答案上,找出缺陷並加以修訂,可能反覆數輪。其直覺正是人類「重讀自己所寫」的習慣:第一遍把想法寫下來,帶批判的第二遍則抓出矛盾、漏掉的情況或缺乏根據的跳躍。代理同時扮演作者與審稿者。
機制上,這是在單一模型上(或由生成器搭配獨立批評器)執行的「生成—批評—修訂」迴圈。模型先給出候選答案,接著被重新提示,依評分準則或任務規格加以批評,最後依該批評重寫;像 Self-Refine 這類方法會反覆迭代,直到停止條件觸發。關鍵在於:當批評有所錨定時最為可靠——例如跑測試、執行程式碼或檢查工具輸出——而非倚賴模型對其無法驗證的事實作內省。
當「驗證比生成更便宜」時,反思幫助最大:例如發現程式碼未通過單元測試,或草稿違反了明確約束。對模型本就不知道的問題,反思幫助最小,此時無錨點的自我批評可能把正確答案說服掉,或把自己說進一個自信的錯誤裡。好處真實但不均勻,且每一輪都要付出額外推論成本。
缺乏外部訊號的自我反思可能反而降低準確率:批評者與生成者共享盲點,因此應盡量把批評錨定在測試、工具或檢索到的證據上。
又稱
另見