經典與統計學習

主成分分析(principal component analysis)

/ PRIN-suh-pul kum-POH-nent uh-NAL-uh-sis /

主成分分析是一種把帶有幾十、幾百個特徵的資料,擠壓成寥寥幾個,同時盡量少丟真實結構的辦法。想像一團點,儘管它們活在三維空間裡,實際上卻幾乎平鋪在一張傾斜的薄餅上。PCA找出那張薄餅,讓你用區區兩個數字(點落在薄餅上的位置)來描述每個點,而非三個,卻幾乎什麼都沒損失。它是一門找出「你的資料真正在沿哪幾個方向變化」的藝術。

具體而言,PCA尋找資料散得最開的那個方向——點雲最長的那根軸——把它稱作第一主成分。然後它再找下一個散得最開、且與第一根成直角的方向,如此繼續。這些新軸,不過是你原有特徵經過旋轉的組合,按從最有資訊量到最沒資訊量的順序排列。只保留頭幾根——那幾根抓住了大部分變化——把其餘的丟掉,你就壓縮了資料、剝離了雜訊,因為剩下那些方向通常除了抖動外別無他物。

它是對付維度災難的經典良方——那種特徵太多就讓資料變稀疏、模型陷入泥潭的怪病——也是把高維資料壓平成你真能畫出來的兩根軸、從而將其視覺化的心頭好。誠實的局限是:PCA只能捕捉直線式(線性)的結構,所以它會漏掉彎曲或扭轉的模式。而那些新軸是原始特徵的混合物,所以一個主成分很少有一目了然的人類含義——你贏得了緊湊,卻常常丟掉了可解釋性。

你給1000個人量了50項身體尺寸。它們大多彼此相關——高個子往往胳膊長、腳也大。PCA發現,一根合成的軸(「整體身材大小」)加上第二根(「瘦削對粗壯的體型」),就抓住了大部分變化,於是每個人用區區2個數字、而非50個就能概括,而幾乎沒丟什麼真正的細節。

許多彼此相關的特徵,坍縮成寥寥幾根有意義的軸。

PCA只看得見直線式的結構——如果你的資料躺在一個彎曲或扭轉的形狀上,它可能恰恰把你在意的那個模式壓沒了。又因為每個成分都混合了你的原始特徵,那些新軸通常沒有乾淨俐落的人類含義。

又稱
PCA主成分分析主成份分析