经典与统计学习

线性判别分析(linear discriminant analysis)

/ LIN-ee-ur dih-SKRIM-uh-nunt uh-NAL-uh-sis /

线性判别分析解的是一道利落的几何题:如果你不得不把带标签的数据压扁到一条直线上,那么该沿哪个方向去压,才能让各组尽量保持分离?想象苹果和橙子按重量和颜色画出来,在一张二维纸上聚成两团。把它们的影子投到错误的线上,两团就糊成一片;投到LDA所挑的那条线上,苹果的影子和橙子的影子便落成两簇齐整、间隔分明的点,你用一道刻痕就能把它们分开。

它的做法,是同时平衡两个目标:让不同组的中心沿那条线尽量拉远,同时让每组自身的散布尽量收紧。理想的方向,会让组间的间隔相对于组内的散乱达到最大。这和PCA不同——PCA只追逐整体变化最大的方向、完全无视标签;而LDA用上了标签,它刻意去寻找那条最能把各类区分开的方向。它既可以读作一种降维的手段,也可以读作一个独立的分类器。

它的长处是快、简单、解释清晰;它是个强基线,哪怕数据有限也能从容应对,因为它靠强假设来填补空白。而那些假设正是它诚实的脚注:LDA假定每一组都形如钟形曲线,且各组拥有大致相同的散布与形状。当这大致成立时它极为出色;当各组散布悬殊或边界弯曲时,它就会被更灵活的方法比下去。请注意缩写的不巧撞车——这个LDA与潜在狄利克雷分配(Latent Dirichlet Allocation,一种主题建模方法)毫无关系,只是凑巧共用了同一组首字母。

两种鸢尾花按花瓣的长与宽画出来,形成两个相互重叠的椭圆。PCA可能会挑出整体散布最大的方向——而那恰好把两个物种糊到一起。LDA则挑出那条把两个物种的平均值狠狠拉开的对角线;往它上面一投,两个物种就落成干净分开的两条带子。

PCA无视标签、追求散布最大;LDA则用上标签、追求分离最大。

关键的对照:PCA是无监督的、追求整体方差最大;LDA是有监督的、追求类间分离最大。它假设各组呈钟形、散布相等,所以这个前提成立时它大放异彩、不成立时则会失手。(别把它和潜在狄利克雷分配混为一谈,那是个首字母相同、却毫无关联的主题模型。)

又称
LDAFisher's linear discriminant线性判别分析線性判別分析费舍尔判别