部署與效率
邊緣部署
邊緣部署不把每張影像送到雲端伺服器再等回覆,而是直接在資料誕生的裝置上執行視覺模型——監視攝影機、無人機、汽車、工廠感測器或手機。這麼做是為了延遲(沒有網路往返)、隱私(原始影像永不離開裝置)、可靠性(離線也能運作),以及成本或頻寬(不必把影片串流到資料中心)。問題在於,相較於資料中心的 GPU,這些裝置非常迷你。
決定性的限制包括:運算(常為數 GOPS 到數 TOPS,有時是完全沒有浮點運算單元的微控制器)、記憶體(數 KB 到數 MB 的 RAM,因此整個模型加上其激活值都必須塞得下),以及功耗與散熱(靠電池、常無風扇,因此持續吞吐遠低於瞬間峰值)。這些迫使你做模型壓縮——int8 或 int4 量化、結構化剪枝、蒸餾——並搭配高效架構,以及特定硬體的執行環境,如 TFLite、ONNX Runtime、Jetson 上的 TensorRT、CoreML、ExecuTorch,以及微控制器上的 TFLite-Micro/TinyML。
因此邊緣部署是一個共同設計問題:你要為目標 NPU 或 DSP 同時選定架構、壓縮方案與執行環境。真實案例有 Jetson 與 Coral Edge TPU 上的 YOLO、MobileNet、EfficientNet 變體,以及行動端蒸餾版 SAM 之類的分割模型,還有裝置端的人臉或場景辨識。你必須量測真正決定成敗的事物:裝置端延遲、散熱降頻下的持續吞吐、峰值記憶體與每次推論能耗——而不只是 FLOPs。
雲端對上邊緣是一種取捨,而非絕對。許多真實系統採混合式:一個便宜的裝置端模型先過濾或觸發,只有困難或罕見的案例才升級到較大的雲端模型,藉此在延遲、隱私與準確率之間取得平衡。
又称