多元优化

最小二乘(least squares)

你有一团数据点,想要最好地拟合它们的直线——或曲线、或模型。但没有一条直线能穿过每个点,所以最好需要一个精确的含义。最小二乘的回答是:最佳拟合就是使数据与模型之间竖直间隙的平方之和尽可能小的那个。平方重重地惩罚大的偏差,而且很方便地使总和成为一个可用微积分最小化的光滑函数。

把它框成一个优化。当模型对未知参数线性依赖时,残差平方和是这些参数的凸二次函数——一只完美的碗。令其梯度为零(一个无约束优化)得到一个线性方程组,即正规方程,其解就是最小二乘拟合。由于目标是凸的,这个驻点是唯一的全局极小:最小二乘绝不会陷进虚假最优。平方也正是让数学变干净的原因;改为最小化绝对误差之和,是一个合理但更难、非光滑的问题。

最小二乘是全部科学与工程中使用最广的估计方法:线性回归、仪器校准、拟合轨道(高斯为追踪小行星谷神星而发明了它),以及大量机器学习底层的数据拟合层。它诚实的提醒是真切的:由于对残差取平方,最小二乘对离群点敏感——单个严重错误的数据点就能把整个拟合朝自己拽。而且它假定模型形式正确;对错误模型的良好最小二乘拟合,仍然是错误的模型。

对数据点 (x_i, y_i) 拟合直线 y = m x + b,就是选取 m 和 b 使 (y_i - m x_i - b)^2 关于 i 之和最小。对 m 和 b 求导并令二者为零,便产生两个线性方程——正规方程——可写出闭式解。

最小化残差平方和,把直线拟合化为一个整洁的无约束优化。

最小二乘最小化平方误差,这使离群点以平方计权——一个坏点就能主宰全局。当预期会有离群点时,稳健的替代方法(最小绝对偏差、Huber 损失)更明智,代价是优化更难。

又称
least-squares fittingmethod of least squares最小二乘法最小平方法