经典与统计学习

逻辑回归(logistic regression)

/ luh-JIS-tik ree-GRESH-un /

别被名字骗了,逻辑回归其实是个分类器——它回答「是/否」这类问题,而不是预测一个原始数字。这封邮件是垃圾邮件吗?这位病人会复发吗?这位顾客会点击吗?它不会硬给一个干巴巴的「是」或「否」,而是返回一个介于0到1之间的概率,比如「这是垃圾邮件的可能性有83%」。这种留有余地的答案,往往比一句生硬的判决有用得多,因为你可以自己选择行动的阈值。

在内部,它的开头与线性回归一模一样——先做一个输入的加权和——然后把这个和送过一条S形曲线,叫作逻辑函数(又称S形函数),它能把任何数字,无论多大多小,温柔地压进0到1的区间。在一侧远端它饱和成近乎确定(0.99),另一侧远端则近乎不可能(0.01),而在模糊的中段变化最快。权重经过调整,使预测出的概率尽可能贴合训练数据里真实的「是/否」标签。

它之所以站得住脚,是因为它速度快、稳健、且可解释:每个权重都告诉你某个特征把胜算往哪边、推多用力。在医学、信用评分和市场营销里,它都是标准的首次尝试,也是更精巧的模型必须设法超越的基线。它的软肋和它的表亲一样——它在两类之间画的是一条直线边界,所以如果真正的分界线是弯的,除非你亲手设计出更巧妙的特征,否则它会很吃力。

一家诊所根据一个数字——空腹血糖——预测糖尿病风险。逻辑回归学到一条S曲线:血糖90时它输出5%的风险,126时越过50%,200时读到95%。医生把报警阈值设在比如30%——这个选择独立于模型本身。

和线性回归一样的加权和,经过S曲线弯折成一个概率。

它叫「回归」,做的却是分类——这是个长盛不衰的混淆点。还要记住,它给出的概率,诚实程度不会超过你的数据:用有偏的样本训练它,那些百分比无论看起来多自信,也一样是偏的。

又称
logit model逻辑回归邏輯迴歸对数几率回归