平均故障間隔(MTBF)
/ M-T-B-F /
假設你長時間觀察一群機器,記下每一台運轉多久才壞。把這些運轉時段平均起來,就得到平均故障間隔,也就是 MTBF——一段正常運作期的典型長度。它是你在磁碟、電源供應器與伺服器上看到的招牌可靠度數字,通常以小時計:MTBF 為 1,000,000 小時,意思是平均而言一段正常運作期會持續一百萬小時才迎來下一次故障。
最重要的一件事是搞懂 MTBF 是對什麼取平均。它不是對單一裝置壽命的承諾。一顆 MTBF 為 120 萬小時的磁碟不會跑 137 年;那個數字是用一大群裝置在短期測試下算出來的,真正描述的是故障率。關係很簡單:故障率大約是 1 / MTBF。所以 1,000 顆各 MTBF 為 1,000,000 小時的磁碟,合起來大約產生 1,000 / 1,000,000 = 每 1,000 機隊運轉小時壞一顆——大概每六週一次。MTBF 告訴你在許多裝置上多久會遇到一次麻煩,而不是某一台能撐多久。
MTBF 直接連到可用度。以 MTTR 為平均修復時間,可用度 = MTBF /(MTBF + MTTR),所以大的 MTBF 和小的 MTTR 都會把可用度往上推(見 availability)。一個微妙的誠實之處:真實元件在整個壽命中並非以固定速率故障——存在一條「浴缸曲線」,初期因製造瑕疵多一些早夭,末期因磨耗多一些壽終,中間是平坦的低速率區段。MTBF 數字描述的是那段平坦的中段,並悄悄假設你正運作在那裡,這通常成立,但並非永遠。
一座資料中心跑 10,000 顆磁碟,每顆標示 MTBF = 1,000,000 小時。每小時預期故障數 = 10,000 / 1,000,000 = 0.01,也就是大約每 100 小時壞一顆,或一年約 88 顆。這就是為什麼大型機隊總會為例行的磁碟更換做規劃——故障不是「會不會」,而是穩定的「何時」。
規模把巨大的 MTBF 變成頻繁的故障:10,000 台讓百萬小時的 MTBF 意味著每 100 小時壞一台。
切勿把 MTBF 讀成單一裝置保證的壽命。它是機隊層級的速率;一顆 MTBF 百萬小時的磁碟明天照樣可能壞,而在數千顆裡一定會有幾顆壞。