隨機矩陣理論

馬爾欽科-帕斯圖爾律(Marchenko-Pastur law)

/ Marchenko-Pastur = mar-CHEN-ko PAS-toor /

馬爾欽科-帕斯圖爾律是半圓律在樣本共變異數矩陣上的姊妹:它是當真實共變異數為單位矩陣時,高維樣本共變異數矩陣特徵值的普適極限密度。它回答了困擾每一位高維統計學家的實際問題:若我從純各向同性雜訊的資料估計共變異數,我的估計之特徵值譜會長成什麼樣子,雜訊在何處結束、訊號又在何處開始?

設 S = (1/n) X X^* 為由 p×n 矩陣 X(元素均值 0、變異數 1 的獨立同分布)構成的 p×p 樣本共變異數矩陣,並令 p 與 n 皆增長且長寬比 y = p/n 收斂到 (0, 無窮) 中的常數。則 S 的經驗譜分布收斂到馬爾欽科-帕斯圖爾律。對 y <= 1,它是區間 [a, b] 上的絕對連續密度 rho(x) = (1/(2 pi y x)) sqrt((b - x)(x - a)),其中邊緣為 a = (1 - sqrt(y))^2 與 b = (1 + sqrt(y))^2。對 y > 1(變數多於樣本,故 S 奇異),矩陣有 p - n 個精確的零特徵值,在 0 處貢獻質量 1 - 1/y 的原子,外加同樣在 [a, b] 上的連續密度。邊緣 a 與 b 是譜支撐:當 y = 1 時它們是 0 與 4,當 y 很小時它們向 1 收緊(恢復古典的 S -> 單位矩陣)。MP 律的 Stieltjes 變換滿足一個二次自洽方程,是半圓的共變異數對應。

馬爾欽科-帕斯圖爾律是高維統計的主力。它是虛無模型:若你的資料真的是無結構的雜訊,你的樣本共變異數特徵值會充滿 [a, b] 而不多,所以任何落在上邊緣 b 之上的特徵值是真實訊號(一個真實的變異方向)的統計證據,而非抽樣假象——這正是尖峰模型與 BBP 轉變背後的邏輯,也是金融中清理經驗共變異數矩陣的邏輯。一個注意事項:乾淨的 MP 律假設母體共變異數為單位矩陣(各向同性雜訊)且元素變異數有限。一般的母體共變異數 Sigma 會產生一個變形的律——MP 與 Sigma 譜的自由乘法卷積——而重尾元素會徹底破壞此律。且上邊緣 b 是體相邊緣;最大特徵值在 b 附近的波動又是 Tracy-Widom,於 n^(-2/3) 尺度上。

一位投資組合分析師有 p = 500 檔股票在 n = 1000 天的報酬,故 y = 0.5。馬爾欽科-帕斯圖爾上邊緣為 b = (1 + sqrt(0.5))^2 約等於 2.91。樣本相關矩陣中任何低於 2.91 的特徵值在統計上與雜訊無法區分、應被正則化;遠高於 2.91 的一兩個特徵值(一個全市場的「模態」)才是真實、可交易的訊號。MP 邊緣就是雜訊的截斷。

高於 MP 上邊緣 b = (1+sqrt(y))^2 的特徵值是訊號;其內的一切都是雜訊。

MP 律假設各向同性的母體共變異數(單位矩陣)。對非單位的 Sigma,極限譜是 MP 與 Sigma 譜的自由乘法卷積,而非 MP 本身;把素樸的 MP 邊緣當作雜訊截斷僅對真正的白雜訊有效。

又称
MP lawMarchenko-Pastur distributionMP 律馬-帕分布