Wasserstein 度量
/ VAH-ser-shtine /
Levy-Prokhorov 度量度量弱收斂,但對質量實際移動多遠以及尾部大小視而不見。許多應用,統計、最優運輸、經驗測度的收斂、機器學習,想要一個確實衡量運輸質量成本且控制動差的距離。由最優運輸建構的 Wasserstein 度量正是如此。它們已成為現代機率及其應用中使用最頻繁的工具之一。
固定 p >= 1 與度量空間 (S, d)。機率測度 mu、nu(具有限 p 階動差)之間的 p-Wasserstein 距離為 W_p(mu, nu) = ( inf_pi integral d(x, y)^p dpi(x, y) )^{1/p},其中下確界跑遍 mu 與 nu 的所有耦合 pi,即所有以 mu、nu 為邊際的聯合律。它是把 mu 變形為 nu 的最小平均運輸成本(以 d^p 衡量距離),故稱「推土機距離」。對 p = 1,Kantorovich-Rubinstein 對偶給出乾淨的替代形式 W_1(mu, nu) = sup { integral f dmu - integral f dnu : f 為 1-利普希茨 }。在 R 上,W_p 有明確的分位數公式 W_p(mu, nu)^p = integral_0^1 |F_mu^{-1}(u) - F_nu^{-1}(u)|^p du,線上的運輸就只是匹配分位數。
關鍵在於 W_p 度量的收斂「強於」弱收斂:W_p(mu_n, mu) -> 0 當且僅當 mu_n => mu「且」p 階動差收斂,integral d(x_0, x)^p dmu_n -> integral d(x_0, x)^p dmu。所以 Wasserstein 收斂是弱收斂加上直到 p 階的動差收斂;等價地,弱收斂加上 p 次方的均勻可積性。這正是為何當你關心期望值而不只是分布時它是正確的工具,也是為何以 W_2 或 W_1 陳述的中央極限定理或經驗測度界,確實比以 Levy-Prokhorov 陳述者更具資訊量。
在 R 上設 mu = delta_0 與 nu_n = (1 - 1/n) delta_0 + (1/n) delta_n。則 nu_n => mu 弱收斂(且 Levy-Prokhorov 趨於 0),但 W_1(nu_n, mu) = (1/n) * n = 1 對所有 n 成立,它從不收斂,因為逃逸的質量行進距離 n。Wasserstein 度量「看得見」弱收斂所忽略的逃逸質量;這正是均勻可積性的失效。
Wasserstein 偵測到弱收斂錯過的逃逸質量;即使 nu_n => delta_0 仍有 W_1 = 1。
W_p 要求 p 階動差有限才有限,且 W_p 收斂嚴格強於弱收斂(它加上 p 階動差收斂)。勿用它來度量整個 P(S) 上的弱收斂;那應用 Levy-Prokhorov 或有界利普希茨度量。