代理式人工智慧與工具使用
Toolformer(自監督工具使用)
Toolformer 是一種方法,教語言模型自行決定「何時」呼叫外部工具、用「哪個」工具、帶「什麼」引數——而且不需要人工標註的工具使用範例。其巧妙之處在於:監督訊號來自模型自己對「有沒有用」的判斷——唯有看到結果能讓接下來的文字更容易預測時,一次工具呼叫才站得住腳。模型等於自己替訓練資料標註上 API 呼叫。
流程是取樣、過濾、微調。模型先在未標註文本的許多位置提出候選 API 呼叫。每個呼叫都被執行、結果被插入;唯有當該呼叫使後續詞元的語言建模損失,相較於不呼叫或空結果至少降低一個門檻時,才會被保留。存活下來的呼叫構成一份增強資料集,模型在其上以一般的下一詞預測進行微調,因此推論時它便自然地在有幫助處發出呼叫,並就地讀回回傳值。
這個自監督過濾器很優雅,但其觸及範圍受限於損失訊號:若某工具的好處不會反映為更低的下一詞損失,就很難用這種方式學會;該法也假設「帶有答案的結果」能整齊地嵌入周圍文本。它確立了一項原則——工具使用可以從「效用」而非「示範」中學得——這成為日後代理訓練所立足的基礎。
L_i^{-}-L_i^{+}\ \ge\ \tau\quad\Longrightarrow\quad \text{keep the API call at position }i
唯有執行該候選呼叫能使後續詞元損失至少下降門檻 tau 時,才保留它。
Toolformer 的監督訊號是「插入工具結果後下一詞損失的下降」;價值無法被該損失捕捉的工具,對它幾乎是隱形的。
又稱
另見