視覺神經網路基礎

均方誤差

均方誤差(MSE)是迴歸的主力損失,用於預測連續數字而非類別。你取每個預測與其目標的差、平方它(如此高估與低估都算成正誤差,且大錯不成比例地計入)、再對所有預測取平均。平方是其決定性選擇:誤差為 4 被罰 16,是誤差為 2 被罰 4 的四倍,所以 MSE 極度在意大的偏差。

對 N 個值的預測 y_hat 與目標 y,MSE = (1/N) 乘以 對所有 i 的 (y_hat_i - y_i)^2 之總和。它是預測與目標之間平方歐氏(L2)距離的平均。它對每個預測的梯度是 2(y_hat_i - y_i)/N,與誤差成線性,所以修正幅度隨你錯得多離譜而增長。最小化 MSE 是在「目標等於模型輸出加上高斯雜訊」假設下的最大似然估計,而使期望平方誤差最小的值是目標分布的均值,這就是 MSE 訓練的迴歸器會預測條件均值的原因。

MSE 對預測是平滑且凸的,提供乾淨、穩定的梯度。但它對大誤差的敏感使它對離群值脆弱,而「預測均值」會使它把多峰輸出糊化:純用 MSE 訓練的影像重建或預測模型會產生典型的模糊結果,因為在平方誤差下的安全做法是把所有合理答案平均掉。替代方案各有取捨:平均絕對誤差(L1)預測中位數、更穩健也更銳利,但梯度為常數;Huber 或 smooth-L1 在零附近像 L2、在尾部像 L1,兼顧穩定性與抗離群值。

MSE 與 L1 在整個視覺領域用於連續目標與重建:影像超解析與去雜訊、深度與光流迴歸、關鍵點與邊界框座標迴歸,以及自編碼器中的像素重建項。關鍵的是,現代影像生成背後的擴散模型是以均方誤差目標訓練的(預測加進影像的雜訊),顯示 MSE 在前沿仍然活躍。為了打敗 MSE 的模糊,生成器會在其上再加感知或對抗損失。

目標 (3.0, 5.0)、預測 (2.5, 7.0):誤差 (-0.5, 2.0)、平方 (0.25, 4.0)、MSE = (0.25 + 4.0)/2 = 2.125。單一個大誤差(2.0)主導一切,貢獻是小誤差的 16 倍。

為何重要:MSE 的「預測平均」行為是生成輸出模糊的根源,也是分類應使用交叉熵、而非對 one-hot 標籤用 MSE 的原因(對 one-hot 用 MSE 訓練得很差:與壓縮式輸出搭配時會梯度消失,且帶有錯誤的機率假設)。

又稱
MSEL2 lossquadratic loss