非線性最小平方法(nonlinear least squares)
線性最小平方法之所以有效,是因為模型對其未知數線性依賴,給出一次到位的閉式答案。但許多真實模型沒這麼好說話——擬合指數衰減 y = a*exp(-b t)、S 形曲線,或數個高斯之和,都意味著參數以非線性方式進入。非線性最小平方法仍最小化殘差平方和,但如今沒有公式;你必須迭代地搜尋最佳參數,一步步改進一個猜測,直到殘差不再縮小。
目標是最小化 sum_i r_i(p)^2,其中每個殘差 r_i(p) = y_i - f(x_i; p) 對參數向量 p 非線性依賴。主流策略是在當前猜測附近把模型線性化:建立雅可比矩陣 J(各殘差對各參數的導數),把這個彎曲問題在 p 附近近似為對「步長」的「線性」最小平方問題。這就是高斯-牛頓法:每次迭代解線性最小平方系統 J delta = -r 求修正量 delta,更新 p -> p + delta,重算,再重複。在殘差小的好擬合附近它收斂得快,幾乎像牛頓法,因為線性近似在那裡極佳。
兩個誠實的提醒把它與線性情形區別開來。其一,它確實是個最佳化問題,所以可能卡在局部極小、嚴重依賴初始猜測,且不保證找到全域最佳擬合——這是數值最佳化的前味。其二,殘差大或模型嚴重非線性時,純高斯-牛頓可能過衝或發散;標準的穩健修正是列文柏格-馬夸特法,它把高斯-牛頓與謹慎的梯度下降步混合。儘管有這些注意事項,非線性最小平方法仍是科學曲線擬合、參數估計與模型校準的日常工具。
用 y = a*exp(-b t) 擬合衰減資料:給一個猜測 (a, b),算殘差 r_i = y_i - a*exp(-b t_i) 及對 a 與 b 的偏導所成的雅可比矩陣,解線性最小平方步 J delta = -r,更新 (a, b),並迭代到擬合穩定為止。參數 b 以非線性方式進入,這正是沒有閉式的原因。
線性化、走一個最小平方步、重複——高斯-牛頓把彎曲的擬合化為一連串線性擬合。
與線性最小平方法不同,非線性版本是個真正的最佳化問題:它可能收斂到局部而非全域極小,並依賴初始猜測。糟糕的起點可能給出自信卻錯誤的擬合。