高維共變異數估計(high-dimensional covariance estimation)
高維共變異數估計提出多變量統計的奠基問題,置於維度 d 與樣本數 n 相當、甚至更大的現代情境下。共變異數矩陣 Sigma 編碼隨機向量的所有二階結構——變異數、相關、主方向——而幾乎每個多變量方法(主成分分析、線性判別分析、高斯圖模型、投資組合最佳化)都建立在它的估計之上。經典答案,即樣本共變異數,在 n >> d 時極佳,但隨 d 增長趨向 n 而變得不可靠、終至奇異;精確理解它如何如此、以及該改用什麼,正是高維統計的核心。
由獨立同分布置中樣本 x_1、…、x_n 得到的樣本共變異數為 hat-Sigma = (1/n) sum_i x_i x_i^T,是 Sigma 的不偏估計量。核心問題是「算子範數」誤差 || hat-Sigma - Sigma ||。對於具次高斯座標(或更尖銳地,次高斯分布)的樣本,關鍵定理說 || hat-Sigma - Sigma || <= C ||Sigma|| (sqrt(d/n) + d/n) 以高機率成立——故相對誤差由比值 d/n 控制,而你需要 n 與 d 成比例(在常數意義下 n >> d)才能在算子範數下良好估計共變異數。這正是情境陳述:在比例情境 d/n -> gamma > 0 下誤差不消失,且 hat-Sigma 的特徵值被攤開(馬爾欽科-帕斯圖爾)而非塌縮到 Sigma 的特徵值上。證明路徑正是本領域的集中工具:hat-Sigma 是獨立秩一矩陣之和,故矩陣 Bernstein 給出乾淨(略有 log-d 損耗)的界,而不帶對數因子的尖銳 d/n 速率來自一個 epsilon-網/通用鏈接論證,它控制 sup(在單位 v 上)|(1/n) sum (<x_i, v>^2 - E)|——一個次指數經驗過程的上確界。
此處實務訊息與誠實的提醒密不可分。當 d/n 不小時,樣本共變異數在算子範數下可證為差,其特徵結構被扭曲(最大樣本特徵值被向上偏、最小者向下偏——特徵值攤開),故必須施加結構才能良好估計:Sigma 的稀疏性(閾值估計量)、低秩加雜訊的尖峰模型(其中 BBP 相變告訴你植入的方向只有在訊噪比閾值之上才可偵測)、帶狀性,或朝目標收縮(Ledoit-Wolf)。對於重尾資料,次高斯速率完全失效,須用穩健估計量(中位數之均值、截斷)以找回 d/n 速率。關鍵地,即便 hat-Sigma 的「Frobenius 範數」誤差可接受,其領先特徵「向量」在比例情境下也可能完全錯誤——共變異數的一致性並不蘊含主成分分析的一致性,這是高維共變異數工作中最重要、也最常被遺忘的一條提醒。
在 d = 500 個特徵與 n = 1000 個次高斯樣本下,d/n = 0.5,故 sqrt(d/n) ~ 0.7:樣本共變異數的算子範數誤差與 ||Sigma|| 本身相當——70% 的相對誤差。要把算子範數誤差降到 10%,你大約需要 n ~ 100 d ~ 50000 個樣本(因速率為 sqrt(d/n)),否則必須利用結構(稀疏性、收縮)以僅有的 1000 個樣本做得更好。
算子範數誤差約以 sqrt(d/n) 縮放——你需要與維度成比例的樣本數。
hat-Sigma 在 Frobenius 範數下的一致性「不」蘊含其領先特徵向量的一致性:在比例情境 d/n -> gamma > 0 下,主成分分析可能不一致(BBP 相變)。乾淨的 sqrt(d/n) 速率需要次高斯資料;重尾須用穩健估計量才能找回它。