高效與邊緣人工智慧

提前退出網路

並非每個輸入都同樣困難。提前退出網路在中間各層加上小型分類頭,讓簡單的樣本在模型半途就能作答、略過其餘運算,而真正困難的樣本則一路跑到最後一層。

在每個出口,模型估計自己的信心——例如 softmax 熵或最大機率——若越過門檻就停下,否則繼續往深處走。訓練時最小化所有出口損失的加權和,使中間特徵本身就具預測力。BranchyNet 在視覺上這麼做,DeeBERT 或 PABEE 則用於編碼器型 Transformer;對生成式語言模型,相關的想法是逐詞元退出,並對被略過的層重用或複製隱藏狀態。

提前退出把固定成本的模型變成具輸入自適應運算的模型,以可控的精度代價換取平均延遲的下降。它在實務上的主要摩擦是批次處理:不同輸入在不同深度離開,所以單純的批次會被其中最慢的成員拖住。

提前出口的信心常常校準不良,所以退出門檻必須以保留資料調校,而非想當然耳——一個看似簡單卻過度自信的輸入,可能會錯誤地提前退出。

又稱
early exitadaptive depth提前退出