依 r 階平均收斂(L^p 收斂)
前面幾種模式問的是 X_n 是否接近 X。這種模式問同樣的事,但用「誤差的平均大小取某個次方」來衡量接近程度。它是能量與最小平方的自然語言:當 r = 2 時,它是變異數、回歸與傅立葉級數背後的那種收斂,重點在於平均平方誤差。
精確地說:X_n 依 r 階平均收斂到 X(r >= 1),指的是當 n 趨於無窮時 E[ |X_n - X|^r ] 趨近 0。r = 1 的情形是依平均收斂(平均絕對誤差消失);r = 2 是均方或 L^2 收斂(平均平方誤差消失)。做法很直接:構造誤差 X_n - X,取其絕對值的 r 次方,對所有結果平均,再檢查這個單一數字是否邁向零。因為它控制的是平均大小,這種模式也迫使均值收斂,以及(在 r = 2 時)變異數收斂——這是較弱的模式所不保證的。
它在眾模式中的位置如何?依 r 階平均收斂蘊含依機率收斂(對 |X_n - X|^r 套用馬可夫不等式即得),因而也蘊含依分布收斂。但它與幾乎必然收斂之間互不蘊含——兩者確實不同。誠實的陷阱是:即使路徑完美安定,r 階平均收斂仍可能失敗:若一個序列幾乎必然收斂到 0,卻偶爾取一個帶著固定期望大小的巨值,平均誤差就不必縮小。少數罕見巨人的貢獻可以主宰平均,即使典型值已然消失。
令 X_n 以機率 1/n 等於 n,否則為 0。則 X_n 依機率收斂到 0(尖峰罕見)。但對每個 n 都有 E[|X_n|^1] = n(1/n) = 1,所以它「並不」依一階平均收斂到 0——罕見的巨值 n 恰好抵銷了它的罕見性,使平均誤差釘在 1。
依機率收斂不保證依平均收斂:罕見的巨值能使平均誤差無法縮小。
均方(r = 2)是最常見的情形,藏在變異數與最小平方之後。L^r 收斂蘊含依機率收斂,但與幾乎必然收斂在邏輯上彼此獨立。