评估与指标

决定系数(R-squared)

/ AR-SKWAIRD /

决定系数(R²)回答了一个公道的问题,而这是原始误差分数答不了的:我的模型,到底比那个最蠢的合理猜测强不强?对一个数字而言,最蠢的猜测就是完全无视输入,永远预测平均值。R²衡量的,是「在那个偷懒的基线之上,你的模型还额外解释了数据里多少的变化」,并把它放在一个干净的0到1的尺度上。

R²等于0,意味着你的模型并不比「永远猜平均值」更强——它什么也没解释。等于1,意味着它把每个预测都完美命中。等于0.7,意味着它解释了数据里大约70%的起起伏伏,剩下30%没能解释。由于它无量纲,你可以在不同问题、不同单位之间去比较它,这是MSE或MAE永远做不到的。(令人意外的是,它甚至可以变成负的——那意味着你的模型比平均值基线还差,这是一种真实而令人谦卑的可能。)

诚实的提醒很重要。高R²并不意味着你的模型正确、有因果关系,或能在新数据上奏效——你只要往里加更多输入变量,哪怕是没用的,就能把它抬高,这正是人们用「调整后R²」来惩罚这种做法的原因。而低R²也未必就是失败:有些现象本就充满噪声,能解释比方说股价波动的哪怕20%,都可能很有价值。R²描述的是拟合,而不是真相。

一个用「学习时长」预测考试成绩的模型,得到R²=0.64。读法是:学习时长解释了「学生成绩为何偏离班级平均」当中约64%的原因;剩下的36%来自模型看不见的一切——睡眠、先备知识、运气、纯粹的噪声。

R²=你的模型所解释的、数据变化的那一部分比例。

往里加更多输入变量,只会把朴素的R²往上推,绝不会把它往下拉——所以R²上升并不能证明模型变好了。要用「调整后R²」,它会为多出来的变量扣分;并且永远要去确认这个拟合在留出数据上也站得住,而不只是在被调过参的那批数据上。

又称
决定系数決定係數R-squaredcoefficient of determinationR方