高效與邊緣人工智慧
硬體感知神經架構搜尋
紙面上浮點運算量最少的模型,在某顆晶片上未必最快——記憶體佈局、核心支援與平行度比乘加次數更重要。硬體感知 NAS 解決此事的方法,是把真實的目標裝置放進搜尋目標,於是它在實際量得的延遲或能耗下優化精度,而非依賴某個代理指標。
由於在真實硬體上替每個候選量測延遲很慢,這些方法會建立一個延遲預測器——常是把每裝置量測一次的各運算子成本相加的查找表,或一個小型學習模型——再把它折進多目標或受限的搜尋中,例如「精度減去延遲懲罰」,或「在延遲預算下求精度」。MnasNet、ProxylessNAS、FBNet 與 Once-for-All 都是例子;Once-for-All 訓練單一超網路,再為每個裝置特化出子網路而不必重新搜尋。
結果是因裝置而異的架構——手機 CPU、DSP 或邊緣 NPU 各有不同——並提醒著我們:效率唯有相對於模型實際執行的場域,才具有意義。
浮點運算量與延遲只有微弱相關;一個浮點運算量很少的運算子,若受記憶體限制或在目標上沒有快速核心,仍可能主導執行時間。
又称
另见