統計學習理論

間隔泛化理論

一個勉強把訓練點分開的分類器——預測值都徘徊在決策邊界附近——是脆弱的;而一個自信地分類、把每個正確點都推到自己這側遠處的分類器,則是穩健的。間隔理論把這份自信轉化為泛化保證:重要的不只是你有沒有把訓練標記分對,而是分對時的間隔有多大。大間隔讓你能用一個忽略環境維度、甚至忽略參數個數的複雜度去界定誤差。

對實值評分器,把零一訓練誤差換成間隔損失——即分類正確但信心低於門檻 gamma 的樣本比例。此界於是讀作:真實誤分類誤差至多為經驗 gamma-間隔誤差,加上縮放後類別的複雜度除以 gamma,再加上低階項,其中複雜度通常是一個隨權重範數(而非個數)縮放的 Rademacher 項。除以 gamma 是關鍵:較大的間隔縮小有效複雜度。這正是支撐向量機與提升法(boosting)泛化理論背後的引擎。

間隔理論解釋了原本看似矛盾的觀察——為何 AdaBoost 在訓練誤差歸零後仍持續改善測試誤差(因為它持續擴大間隔),以及為何受範數控制的過參數化網路能泛化。現代的譜範數歸一化間隔界把它推廣到深度網路。提醒是:這類界對深度學習在數值上通常仍然鬆弛,其用處更多在定性的縮放關係(範數勝過個數),而非精確數字。

R_{0/1}(f)\le \hat{R}_\gamma(f)+\frac{2}{\gamma}\,\hat{\mathfrak{R}}_S(F)+3\sqrt{\frac{\ln(2/\delta)}{2m}}

間隔界:測試誤差由 gamma-間隔訓練誤差,加上 Rademacher 複雜度除以間隔 gamma 所控制。

又称
margin boundsmargin theory間隔理論間隔界