大型語言模型代理與工具使用
自主任務執行(autonomous task execution)
自主任務執行(autonomous task execution)是代理光譜的最遠端:你把目標講一次,代理就自己一路把它做到完成——規劃步驟、呼叫工具、處理結果,只有在工作完成或真的卡住時才回來找你。你不是核可每一步,而是把整個結果託付出去,讓它自己跑。
要做到這點,得同時倚靠其他每一項代理能力:用規劃鋪出步驟、用工具使用去行動、用記憶在長執行裡保持連貫,以及用帶錯誤復原的回饋迴路在中途修正問題。任務愈長、愈開放,這些就愈得撐在一起,因為沒有人在每一輪盯著,在小錯誤長大之前把它抓出來。
完全自主很吸引人,卻是目前最難做對的事,正是因為在沒有監督下錯誤會層層累積,而一個自由行動的代理可能造成真實的傷害。實務上,大多數可靠的系統會把自主性框起來——清楚的限制、檢查點,並在那些有後果或不可逆的動作上,保留一個人在迴路裡。
又称
另见