計算機架構與加速器
GPU 架構(GPU architecture)
GPU 是押注與 CPU 完全不同的處理器:它不靠少數聰明的核心快速做完任何單一任務,而是用數千個簡單核心,同時對數千筆資料做同一種運算。CPU 像幾位數學教授;GPU 像一萬個小學生,各自同時把一對數字相乘。它為了平行替數百萬個像素上色而生,結果發現這設計完美適合任何「極易平行」的數值運算——這也是為何 GPU 如今驅動著科學計算與 AI。
這模型叫 SIMT(單指令、多執行緒):執行緒被綁成群組(每組 32 個的 warp),全體齊步對不同資料執行同一條指令。GPU 不靠大快取、而靠大規模多執行緒來隱藏記憶體延遲——當一個 warp 卡住等記憶體時,硬體立刻切換到另一個就緒的 warp,讓算術單元永遠忙碌。代價是充滿分支、不規則、決策繁多的程式跑得很差;GPU 唯有在同樣的工作對著洪流般的資料一遍遍重複時才會發光。
現代 GPU 還內嵌專為深度學習矩陣乘法而設的張量/矩陣核心——使圖形 GPU 與純 AI 加速器之間的界線變得模糊。
又称
另见