機器學習系統與基礎設施

容錯訓練(fault-tolerant training)

當一個作業在數千張 GPU 上跑數週,硬體故障就不再是罕見意外,而成了家常便飯——在那種規模下,每隔幾小時就有東西壞掉。容錯訓練是讓一次訓練撐過這些故障而不必從頭重來的機制,它把掛掉的節點當成預期中的事件,而非一場災難。

最基本的機制是「存檢查點—重啟」:週期性地存下模型與最佳化器狀態,故障時重新載入最後一個檢查點並續跑,於是損失的工作以檢查點間隔為上界。彈性訓練更進一步——由一個協調者偵測故障,存活的工作者重組它們的行程群組,作業在剩下或替補的節點上繼續,並把狀態重新分片到新的世界大小。配套還包括健康監控與故障偵測、可頂上的熱備援,以及越來越常見的記憶體內或冗餘檢查點與部分回復,以避免從慢速儲存重讀。其中的拉扯是開銷對上損失的工作:頻繁的檢查點與冗餘會吃掉吞吐量,卻讓每次故障變得更便宜。

在前沿規模,容錯根本是讓一次訓練能跑完的關鍵,而它的品質決定了有效利用率——GPU 小時中真正用在推進進度、而非在當機後重算的比例。它完全仰賴底下快速的分散式檢查點與一個彈性排程器。

又称
elastic training容錯訓練彈性訓練