從助理到代理
應用建構的前沿,是從會回答的軟體轉向會行動的軟體。代理式應用前沿指的是圍繞著一個大型語言模型代理(LLM agent)打造的產品:它規劃一項任務、挑選並呼叫工具、觀察結果,然後不斷迴圈直到工作完成。一個會編輯檔案、跑測試的程式助理,一個會瀏覽並綜整的研究工具,一個會開工單的維運機器人——這些都是代理,不是聊天機器人。能力的躍進,伴隨著讓它們可靠這件事的難度躍進。
LLM 智能体的循环图:模型推理、调用工具行动、观察结果,然后重复。
代理式產品需要什麼
代理是一個由模型坐在駕駛座上的編排問題,而它需要比單次呼叫更多的鷹架。它需要透過乾淨介面暴露的工具——越來越常透過像模型情境協定(Model Context Protocol)這樣的標準——好讓模型能對世界採取行動;它需要記憶來在步驟之間攜帶狀態、需要錯誤復原以在某次工具呼叫失敗時存活下來而非整個出軌,並對任何有風險的事保留人在迴圈中。對於龐大的任務,多代理系統(multi-agent systems)則把工作分散到彼此協調的專門代理身上。
前沿模型與通往 AGI 之路
前沿模型(frontier models)是任一時刻能力最強的系統——推著「可能性邊界」前進的那些——而它們在推理、情境長度、多模態與工具使用上持續進步。它們的軌跡點燃了關於通用人工智慧(AGI)的討論:能在大多數任務上匹敵人類的系統。在這裡要誠實。今天的模型既非凡,也脆弱、缺乏接地(grounding),並會以任何人都不會犯的方式自信地出錯。單靠規模擴張能否抵達 AGI,是真正開放的問題。為你今天擁有的「有能力但有缺陷」的模型來打造,並讓評測——而不是炒作——告訴你一個新的前沿模型究竟有沒有幫到你的產品。
一张双对数图,测试损失随模型规模增大而沿直线下降。
負責任的部署
把一個大型語言模型產品上線,就是為它對真實的人所做的事負起責任。負責任的部署意味著對使用者坦白他們正在和 AI 對話、為你明知會發生的幻覺(hallucinations)做設計、保護隱私、留意偏見與傷害,並給人們一條申訴或找到真人的路。它倚靠整套安全工具——護欄、紅隊演練、內容審核——而對最有能力的系統,則倚靠前沿安全政策,把發布卡在危險能力的評估之後。
一张流水线图:人类偏好比较输入奖励模型,再调整语言模型策略。
接下來往哪裡去
你已經走完整段弧線:從單一一次 API 呼叫到一個產品,穿越架構、評測、護欄與成本,一路來到代理式前沿。這個領域走得很快,但紀律不變。從一段紮實的提示小步開始、一切都對著你信任的評測來量測、在微調之前先加 RAG、在逞英雄之前先微調、守住輸入與輸出、只最佳化你量測過的部分,並負責任地部署。前沿會繼續移動——而現在你已經有了能在它之上建構、又不會被它捲走的習慣。