計算機架構與加速器

AI 加速器(NPU)

AI 加速器是為了快速且高效執行神經網路而專門打造的晶片,而非依賴通用 CPU。由於深度學習歸根究柢就是對矩陣做海量的乘加運算,這類晶片塞進數千個小型算術單元(常以脈動陣列形式),平行地完成那些乘法——就像把一台快速計算機換成一整座體育場的人,每人同時加一行數字。NPU(神經處理單元)就是內建於手機與筆電、能在裝置端跑 AI 而不耗光電池的版本。

它們的優勢來自三項對通用性的刻意犧牲:低精度運算(用 8 位元整數或 16 位元浮點取代 32 位元——神經網路容得下這點不精確)、把權重與活化值留在晶片上以閃避記憶體牆,以及最大化重用的專屬資料流。結果是在 AI 工作負載上每瓦效能比 CPU 好 10 到 100 倍。Google 的 TPU、Apple 的神經引擎,以及現代 GPU 內的矩陣核心,都屬於這個家族——領域專用架構最具代表性的例子。

量化——以 8 位元甚至 4 位元而非全精度執行網路——是關鍵推手:它縮減記憶體流量,讓每個算術單元更小,使一顆晶片能塞進更多單元。

又稱
NPUneural processing unitTPUdeep learning accelerator神經處理單元AI 晶片