最小平方法與資料擬合

吉洪諾夫正則化(Tikhonov regularization)

/ TIK-uh-noff /

當最小平方問題病態時,誠實的最佳擬合可能極度不穩定:資料中一絲雜訊就把係數推向極端,而那個逆幾乎不存在。吉洪諾夫正則化藉由溫和地不鼓勵大係數來馴服它。你不再只最小化失配,還懲罰解的大小,以一點點擬合換取大量的穩定。在統計上同一想法稱為脊迴歸——其圖像是:別那麼拼命追逐資料,以致放大了它的雜訊。

具體你最小化 ||A x - b||_2^2 + lambda^2 ||x||_2^2,其中 lambda > 0 是正則化參數,控制你把 x 往小的方向推得多用力。它有乾淨的閉式:正則化法方程 (A^T A + lambda^2 I) x = A^T b。把 lambda^2 I 加到 A^T A 上,使每個特徵值都抬升 lambda^2,所以矩陣永遠可逆,且不論 A 多奇異其條件數都有界——這正是重點所在。從 SVD 來看,每個奇異值的貢獻都乘上一個濾子 sigma_i^2 / (sigma_i^2 + lambda^2),它對大奇異值近 1(保留)、對極小者近 0(壓制),於是嘈雜的小 sigma 方向被平滑地阻尼,而非爆炸。

選 lambda 是關鍵:太小則幾乎沒正則化(退回不穩定的擬合),太大則過度平滑而忽略資料(高偏差)。這就是偏差-變異權衡的明確化——lambda 在擬合與穩定之間轉動旋鈕——而交叉驗證或 L 曲線等工具有助挑選它。一般形式把 ||x|| 換成某矩陣 L 的 ||L x||(懲罰粗糙度或偏離先驗),同樣的想法是各處不適定反問題的底層,從影像去模糊到斷層成像。它是對病態溫和而無所不在的解毒劑。

對奇異值 sigma = 0.001 與 lambda = 0.01,未正則化的偽逆乘上 1/sigma = 1000(巨大的雜訊放大),而吉洪諾夫乘上 sigma/(sigma^2 + lambda^2) ~ 0.001/0.0001 = 10——溫和得多,使擬合不致沿那脆弱方向爆炸。

加上 lambda^2 I 抬升每個奇異值,平滑地阻尼嘈雜的小 sigma 方向。

正則化是刻意引入偏差:正則化解刻意不是精確的最小平方答案,以一點準確度換取大幅降低的雜訊敏感度。參數 lambda 必須謹慎選擇——天下沒有白吃的午餐,只有可調的偏差-變異權衡。

又称
ridge regressionL2 regularizationdamped least squares吉洪諾夫正規化脊迴歸嶺迴歸