推論與服務

級聯推論(cascade inference)

並非每個查詢都需要前沿模型。許多查詢簡單到一個小而便宜的模型就能完美回答,只有少數真正需要最昂貴的那個。級聯推論利用這點,把模型由便宜到昂貴串成一條鏈:查詢先打到小模型,唯有當它的答案看來不足時,系統才升級到更大的模型。在真實流量組合上平均下來,多數查詢都被便宜地解決,從而降低成本與延遲,同時在困難的尾端維持接近大模型的品質。

決策規則是這個設計的核心。一條級聯需要一個「延後訊號」來決定該接受小模型的答案、還是升級——可以是模型信心、一個驗證者或評審模型、跨多次採樣的自我一致性、或一個學出來的路由器。這個門檻設定了成本與品質曲線上的工作點:升級得太積極就失去節省,太少又會放走簡單的錯誤。路由與級聯有個微妙差異:路由是只憑查詢本身就預先預測該用哪個模型,而級聯是先看到一個便宜的答案、再決定是否重試。

當查詢難度高度偏斜、且存在可靠又便宜評估的延後訊號時,級聯最為亮眼;當難度不做昂貴的工作就難以判斷時,它就吃力。

路由器是在回答前就預測該用哪個模型;級聯則是先便宜地回答、再依延後訊號升級——同樣是把算力花在刀口上,但決策的時點不同。

又稱
model cascadeLLM cascade級聯推論模型級聯