尖峰模型與 BBP 轉變(spiked model and the BBP transition)
/ BBP = Baik-Ben Arous-Peche, BAH-eek ben-ah-ROO PEH-shay /
尖峰模型是訊號偵測的隨機矩陣理論,而 BBP 轉變是其核心且優美銳利的結果:一個相變,支配一個埋在高維雜訊中的低維訊號究竟能否從譜中被偵測。這是高維主成分分析的嚴格骨幹,並回答每位實務者面對的問題:我資料的頂端特徵值突出於雜訊體相之上——那是真實的訊號方向,還是純雜訊的一次幸運波動?
尖峰共變異數模型把母體共變異數取為單位矩陣加上幾個大的「尖峰」方向的擾動:Sigma = I + theta v v^*,其中 v 為單位向量、theta > 0 為訊號強度(一個秩一尖峰,可推廣到數個尖峰)。你觀測 n 個樣本並形成樣本共變異數 S = (1/n) X X^*,長寬比 y = p/n。純雜訊部分填滿 [a, b] 上的馬爾欽科-帕斯圖爾體相,其中 b = (1 + sqrt(y))^2。BBP 轉變(Baik、Ben Arous、Peche,2005)陳述存在一個臨界訊號強度 theta_c = sqrt(y)。若 theta <= sqrt(y)(次臨界、弱尖峰),最大樣本特徵值被吸入體相:它收斂到 MP 邊緣 b 且在統計上與雜訊無法區分——尖峰從譜中無法偵測。若 theta > sqrt(y)(超臨界、強尖峰),最大樣本特徵值脫離並躍出邊緣之上,收斂到一個確定性的離群位置 (1 + theta)(1 + y/theta) > b。更引人注目的是,對應的頂端特徵向量只與真實方向 v 有部分相關:平方重疊 |<u_hat, v>|^2 收斂到一個嚴格小於 1 的值(它是 1 - (y/theta^2)/(1 + y/theta),在門檻處恰為 0,並隨 theta 增長趨向 1),故即使被偵測到的尖峰也給出其自身方向的偏誤、衰減的估計。
BBP 轉變重組了高維統計。它精確告訴你 PCA 何時奏效、何時失效,並解釋了實務者經驗上觀察到的現象——低於某訊雜比門檻時頂端主成分是純雜訊,而即使在其之上估計的方向也被系統性地旋轉偏離真值。它支撐訊號處理中的偵測門檻、金融與基因體學中因子數目的估計,以及張量 PCA 與網路社群偵測的現代相變結果。一個脫離的離群值之波動是高斯(而非 Tracy-Widom——後者是無尖峰情形的體相邊緣律)。一個須牢記的注意事項:門檻 theta_c = sqrt(y) 與離群公式依賴於長寬比 y = p/n,所以「一個訊號須多強才能被看見」根本上是你問題有多高維的函數——每樣本更多變數會抬高偵測門檻。而在門檻之下訊號並未從資料中消失,只是從譜中消失;它仍可能被使用超出領頭特徵值的方法所恢復。
你有 p = 200 個特徵與 n = 200 個樣本(y = 1),故 MP 雜訊邊緣為 b = (1 + sqrt(1))^2 = 4。植入一個強度 theta 的秩一訊號。若 theta = 0.8 < sqrt(1) = 1,頂端樣本特徵值停在 4、淹沒於雜訊——無法偵測。若 theta = 3 > 1,它脫離到 (1 + 3)(1 + 1/3) = 4 * 4/3 約等於 5.33,明顯高於體相,且估計的主方向與真值的平方重疊約為 1 - (1/9)/(1 + 1/3) 約等於 0.92——偵測到了,但未完美對齊。
低於 theta_c = sqrt(y) 尖峰藏於體相;高於它特徵值脫離,但特徵向量仍有偏誤。
低於 BBP 門檻 theta_c = sqrt(y) 時尖峰在譜中不可見;高於它特徵值脫離,但估計的特徵向量只與真值部分對齊(重疊嚴格小於 1)。PCA 在門檻附近有偏誤,且可偵測性隨長寬比 p/n 而變。