推論與服務
張量平行推論(tensor-parallel inference)
一個大到放不進單張 GPU 的模型,或單張 GPU 延遲太高的模型,可以拆到好幾張一起在每次前向傳遞上協作的 GPU 上。張量平行是在「一層之內」做這件事:它把龐大的權重矩陣切片分到各裝置,使每張 GPU 只持有一片、算出部分結果。對一個前饋區塊,前一個矩陣按行(column-wise)切、後一個按列(row-wise)切,於是各裝置平行地跑自己那份矩陣乘法;對多頭注意力,則是把不同的頭放到不同裝置。該層的總算力與記憶體被分攤到整組裝置上。
代價是通訊。由於每張裝置只算出部分輸出,這些切片必須用一個集體運算合併——一次 all-reduce 或 all-gather——通常每個 transformer 層做兩次,而這個同步落在每一個 token 的關鍵路徑上。因此張量平行需要極高頻寬、低延遲的連結,例如 NVLink,通常只限於同一台伺服器內的 GPU;一旦拉到較慢的網路上就會卡住。它是壓低大模型每 token 延遲的標準手段,在最大規模的部署中還會與管線平行、資料平行組合使用。
選張量平行度是延遲對效率的權衡:GPU 越多,延遲越低,卻增加通訊開銷,且可能讓每張裝置利用不足。
張量平行是在「層內」切分、且每個 token 都要同步,所以需要伺服器內 NVLink 等級的頻寬;管線平行則是「跨層」切分,能容忍較慢的連結。
又称
另见