隨機矩陣理論

Wishart 樣本共變異數矩陣(Wishart sample covariance matrix)

/ Wishart = WISH-art /

樣本共變異數矩陣是統計學的隨機矩陣。每當你從 n 個觀測估計 p 個變數的共變異數——在金融、基因體學、訊號處理、PCA 中——你都會形成一個經驗共變異數矩陣,而在 p 與 n 相當(並非可忽略地小)的現代體制下,該矩陣是一個真正的隨機對象,其特徵值會系統性地偏離真值。隨機矩陣理論對此扭曲的裁決是馬爾欽科-帕斯圖爾律;產生它的矩陣即 Wishart 樣本共變異數矩陣。

取一個 p×n 的資料矩陣 X,其各列是 p 維向量的 n 個獨立樣本,元素為均值 0、變異數 1 的獨立同分布(故真實母體共變異數為單位矩陣)。樣本共變異數矩陣是 S = (1/n) X X^*,一個 p×p 的 Hermite 矩陣,用以估計單位矩陣。當元素為高斯時,S 服從 Wishart 分布(卡方/伽瑪分布的矩陣推廣);其聯合特徵值密度有一個 Vandermonde 排斥乘積 |lambda_i - lambda_j|^beta 乘以 lambda_i 的某次冪之乘積再乘以 exp(-(n beta/2) lambda_i),即 Laguerre 權——故又名 Laguerre 系綜。S 的特徵值是 X/sqrt(n) 的奇異值平方,全為非負。關鍵體制是高維極限,其中 p 與 n 皆趨於無窮且長寬比 y = p/n 收斂到 (0, 無窮) 中的常數;這正是 S 具有非平凡極限譜的體制。

深刻而違反直覺的是:即使母體共變異數恰為單位矩陣——故真實特徵值全為 1——樣本共變異數矩陣 S 的特徵值並不聚集在 1。它們散開成馬爾欽科-帕斯圖爾體相,其區間寬度由 y = p/n 所支配。當 p = n(y = 1)時,樣本特徵值一路散布從 0 到 4,儘管真值是平坦的 1。這是高維統計的核心教訓:樣本共變異數矩陣是母體共變異數譜的嚴重偏誤估計,而對高維資料天真地做 PCA 是把純雜訊讀成結構。一個注意事項:極限律假設長寬比收斂到有限正常數且元素變異數有限;古典統計體制 p 固定、n -> 無窮(其中 S -> 單位矩陣,由大數法則)是退化情形 y -> 0,只有在那裡估計才表現良好。

模擬 p = n = 1000:抽取一個元素為獨立同分布 N(0,1) 的 1000×1000 矩陣 X 並形成 S = (1/1000) X X^*。真實共變異數是單位矩陣,故每個母體特徵值皆為 1。然而 S 的 1000 個特徵值的直方圖並非在 1 處的尖峰——而是一條從 0 散布到 4 的平滑密度,即 y = 1 時的馬爾欽科-帕斯圖爾律。最小的樣本特徵值接近 0,最大的接近 4,這個從 4 到近 0 的散布完全由有限抽樣所虛構。

真值為單位矩陣、樣本譜卻被抹開:當 p ~ n 時樣本共變異數矩陣扭曲特徵值。

S = (1/n) X X^* 是母體共變異數每個元素的不偏估計,但當 p ~ n 時它是共變異數譜的嚴重偏誤估計。特徵值被散開,最小者被推向 0、最大者被膨脹——在高維中切勿照單全收樣本特徵值。

又称
Wishart matrixsample covariance matrixLaguerre ensembleWishart 矩陣樣本共變異數矩陣