資料同化(data assimilation)
你有一個預測系統如何演化的模型——大氣、海洋、太空船的軌道——同時你也有一道進來的真實量測之流,每筆都有雜訊且不完整。模型與資料彼此不一致,一向如此。資料同化就是把它們融合的有原則的藝術:用進來的觀測持續修正模型運行中的狀態,以取得對真正在發生之事的最佳可能估計。
核心想法是兩個不完美資訊來源之間的加權妥協。每次更新時,你有模型對當前狀態的預報(連同其不確定性)以及一筆新觀測(連同它自己的量測不確定性)。最佳估計是一個偏向較可信來源的混合:各以其不確定性的倒數加權,於是精準的感測器把估計強烈拉向自己,而有雜訊的則幾乎拉不動它。接著你把模型推進到下一個時刻,重複。這正是線性系統卡爾曼濾波器的邏輯;對天氣與海洋建模那種龐大的非線性系統,像系集卡爾曼濾波器與變分方法(4D-Var)這類實用方案把同一想法推展下去,常透過跑一組模型副本來即時估計預報的不確定性。
資料同化是讓天氣預報得以運作、卻無人歌頌的步驟——它產生那個預報模式向前積分的最佳估計起始狀態,並驅動海洋建模、GPS 導航、機器人學與衛星軌道確定。誠實的框定是:它是一個反問題,並共享反問題的陷阱:它好不過模型與所假設的誤差統計,那些不確定性估計本身也是被模型化的、可能出錯,而餵入有偏差的觀測或過度信任一個有瑕疵的模型,都會默默地腐蝕結果。它不從雜訊中創造真相;它在誠實陳述的不確定性下,做出最站得住腳的妥協。
一個氣象中心以對大氣的六小時預報展開一天,接著收到數百萬筆衛星、氣球與測站讀數。資料同化把預報朝觀測推——較信任清晰的量測、較不信任模糊的——以產生「分析場」:對當前大氣的最佳單一圖像,它成為下一份預報的發射點。
預報加上觀測,各依其可信度加權,產生啟動下一份預報的分析場。
同化的好壞不超過模型與所陳述的誤差統計。那些不確定性本身也是被模型化的、可能出錯——有偏差的觀測或過度受信任的模型,會默默腐蝕那個「最佳估計」。