網路量測、管理與效能

網路遙測(network telemetry)

想像一位只有在你打電話預約時才看你狀況的醫生,和一條無論你問不問都安靜地每秒串流你心率的健身手環,這兩者的差別。較舊的網路監控,如 SNMP,大致是用第一種方式運作:管理者不斷打電話給每台設備問「你好嗎?」網路遙測(network telemetry)把這件事反過來——設備持續主動把一串穩定的自身量測推送到收集器,不等被輪詢。

具體而言,用串流遙測時,你讓一台設備訂閱(subscribe)一組指標——介面計數器、佇列深度、CPU 負載、錯誤率——設備接著按它自己的排程送出更新,也許每秒數次,用一種精簡、有結構的編碼,而不是每個值來一次「問與答」。因為設備是推送而非被問,你避開了來回往返與兩次輪詢之間的空檔,並能從遠更多的設備、以遠更高的頻率收集到遠更多的細節。最現代的形式更深入:頻內遙測(in-band telemetry)可以讓每個封包在穿越每台交換器時順手撿起微小的量測值,於是你能精確看出某條流是在網路中的哪裡遇上它的佇列延遲。

值得講清楚為什麼這重要、以及它單靠自己解決不了什麼。每隔幾秒輪詢成千上萬台設備就是擴展不來,而逐秒推送提供了快速自動反應所需的細緻、近即時的可見性。但遙測是資料的消防水帶,不是理解——更快地推送更多數字,只有在下游有東西去儲存、關聯並理解它們時才有幫助。下游那件把資料串流轉成「系統健不健康、為什麼」這類答案的工作,正是可觀測性(observability)所談的事。

路由器不是每 30 秒被 SNMP 輪詢一次,而是透過一條有結構的通道(例如 gNMI)每秒把介面與佇列統計串流到收集器。當一陣微爆發(microburst)填滿佇列 200 ms 時,遙測串流擷取到了它;舊的 30 秒輪詢會在兩次取樣之間完全錯過那個尖峰。

遙測讓設備持續主動推送自己的指標,捕捉到定期輪詢會剛好取樣略過的短暫事件。

遙測是資料串流,不是理解:更快推送更多數字,只有在下游有東西去儲存並關聯它們時才有幫助。把那些串流轉成「系統為何如此表現」的答案,是可觀測性的工作。

又稱
streaming telemetrymodel-driven telemetry串流遙測遙測