多元最佳化
最小二乘(least squares)
你有一團資料點,想要最好地擬合它們的直線——或曲線、或模型。但沒有一條直線能穿過每個點,所以最好需要一個精確的含義。最小二乘的回答是:最佳擬合就是使資料與模型之間豎直間隙的平方之和盡可能小的那個。平方重重地懲罰大的偏差,而且很方便地使總和成為一個可用微積分最小化的光滑函數。
把它框成一個最佳化。當模型對未知參數線性依賴時,殘差平方和是這些參數的凸二次函數——一隻完美的碗。令其梯度為零(一個無約束最佳化)得到一個線性方程組,即正規方程,其解就是最小二乘擬合。由於目標是凸的,這個駐點是唯一的全域極小:最小二乘絕不會陷進虛假最優。平方也正是讓數學變乾淨的原因;改為最小化絕對誤差之和,是一個合理但更難、非光滑的問題。
最小二乘是全部科學與工程中使用最廣的估計方法:線性迴歸、儀器校準、擬合軌道(高斯為追蹤小行星穀神星而發明了它),以及大量機器學習底層的資料擬合層。它誠實的提醒是真切的:由於對殘差取平方,最小二乘對離群點敏感——單個嚴重錯誤的資料點就能把整個擬合朝自己拽。而且它假定模型形式正確;對錯誤模型的良好最小二乘擬合,仍然是錯誤的模型。
對資料點 (x_i, y_i) 擬合直線 y = m x + b,就是選取 m 和 b 使 (y_i - m x_i - b)^2 關於 i 之和最小。對 m 和 b 求導並令二者為零,便產生兩個線性方程——正規方程——可寫出閉式解。
最小化殘差平方和,把直線擬合化為一個整潔的無約束最佳化。
最小二乘最小化平方誤差,這使離群點以平方計權——一個壞點就能主宰全局。當預期會有離群點時,穩健的替代方法(最小絕對偏差、Huber 損失)更明智,代價是最佳化更難。
又稱
另見