經典與統計學習

線性判別分析(linear discriminant analysis)

/ LIN-ee-ur dih-SKRIM-uh-nunt uh-NAL-uh-sis /

線性判別分析解的是一道俐落的幾何題:如果你不得不把帶標籤的資料壓扁到一條直線上,那麼該沿哪個方向去壓,才能讓各組盡量保持分離?想像蘋果和橙子按重量和顏色畫出來,在一張二維紙上聚成兩團。把它們的影子投到錯誤的線上,兩團就糊成一片;投到LDA所挑的那條線上,蘋果的影子和橙子的影子便落成兩簇齊整、間隔分明的點,你用一道刻痕就能把它們分開。

它的做法,是同時平衡兩個目標:讓不同組的中心沿那條線盡量拉遠,同時讓每組自身的散布盡量收緊。理想的方向,會讓組間的間隔相對於組內的散亂達到最大。這和PCA不同——PCA只追逐整體變化最大的方向、完全無視標籤;而LDA用上了標籤,它刻意去尋找那條最能把各類區分開的方向。它既可以讀作一種降維的手段,也可以讀作一個獨立的分類器。

它的長處是快、簡單、解釋清晰;它是個強基線,哪怕資料有限也能從容應對,因為它靠強假設來填補空白。而那些假設正是它誠實的腳註:LDA假定每一組都形如鐘形曲線,且各組擁有大致相同的散布與形狀。當這大致成立時它極為出色;當各組散布懸殊或邊界彎曲時,它就會被更靈活的方法比下去。請注意縮寫的不巧撞車——這個LDA與潛在狄利克雷分配(Latent Dirichlet Allocation,一種主題建模方法)毫無關係,只是湊巧共用了同一組首字母。

兩種鳶尾花按花瓣的長與寬畫出來,形成兩個相互重疊的橢圓。PCA可能會挑出整體散布最大的方向——而那恰好把兩個物種糊到一起。LDA則挑出那條把兩個物種的平均值狠狠拉開的對角線;往它上面一投,兩個物種就落成乾淨分開的兩條帶子。

PCA無視標籤、追求散布最大;LDA則用上標籤、追求分離最大。

關鍵的對照:PCA是無監督的、追求整體方差最大;LDA是有監督的、追求類間分離最大。它假設各組呈鐘形、散布相等,所以這個前提成立時它大放異彩、不成立時則會失手。(別把它和潛在狄利克雷分配混為一談,那是個首字母相同、卻毫無關聯的主題模型。)

又稱
LDAFisher's linear discriminant线性判别分析線性判別分析费舍尔判别