機器學習系統與基礎設施
互連拓樸(interconnect topology,NVLink)
到了大規模,加速器之間的線材和加速器本身一樣要緊。集合運算每一步都在 GPU 之間搬動龐大的張量,所以互連拓樸——哪些裝置連到哪些、以多大頻寬、排成什麼形狀——替訓練吞吐量設下一道硬上限。設計上的問題是這些連結的佈局,而不只是它們的速度。
在節點內,NVLink 提供遠快於 PCIe 的 GPU 對 GPU 直連,常透過 NVSwitch 交叉開關安排,讓任一 GPU 都能以全頻寬連到任一 GPU;這是快速的節點內域。跨節點時,搭配 RDMA 的 InfiniBand(或 RoCE)以胖樹(fat-tree)或蜻蜓(dragonfly)拓樸連接伺服器,每條連結比 NVLink 慢上一個數量級。集合通訊函式庫具拓樸感知:在 NVLink 域內跑頻寬最優的環與樹,跨較慢的網路則跑階層式演算法,並把這些流量與運算重疊以藏起來。
這個頻寬階層直接形塑模型怎麼分片。通訊最密集的張量平行被留在高頻寬的 NVLink 域內,而每步交換較少的管線平行與資料平行則跨越較慢的節點間網路。把一套平行化策略對應到實體拓樸上,是大規模訓練設計的核心一環。
又称
另见