訓練與最佳化

正則化

正則化是任何約束或偏置模型、使其對未見資料泛化更好的技術的統稱,通常做法是阻止模型去擬合訓練集裡的雜訊。統一的直覺是奧坎剃刀:在所有能擬合訓練資料的方式中,偏好較簡單、較平滑、較穩定的解釋,因為那最可能在新資料上持續管用。這個工具箱裡的每種方法都以少許訓練集擬合換取大量測試集可靠度——它們讓模型在見過的資料上略差一點,以換取在沒見過的資料上表現更好。

把工具箱分成顯式與隱式正則化器是有用的。顯式正則化器加入一個刻意追求簡單的項或運算:權重衰減/L2(懲罰大權重以得到更平滑的函數)、L1(把權重推向恰好為零以得到稀疏性),以及丟棄法(隨機停用神經元以防止共適應並近似集成)。這些是你主動開啟、並以一個強度旋鈕調校的東西。

隱式正則化器則是訓練方式的副產物所帶來、改善泛化的效果,儘管正則化並非它們明言的目的。資料擴增注入保留標籤的多樣性以對抗死記;提早停止在模型專精於雜訊之前停下訓練;小批次 SGD 的梯度雜訊把最佳化器偏向更平坦、更穩健的極小值;而批次與層正規化平滑了地形並添了一絲雜訊。實務上現代視覺模型會一次疊用好幾種——例如以 AdamW(權重衰減)、RandAugment 與 Mixup(擴增)、丟棄法與隨機深度,以及餘弦排程訓練的 ViT。

更深的框架是偏差—變異權衡與容量控制。對資料而言有效容量過大的模型會過擬合(高變異);正則化降低那個有效容量——不是靠移除參數,而是靠限制模型可能落腳的函數空間——把它推向甜蜜點,使它夠靈活以捕捉真實模式,卻不至於靈活到去追逐雜訊。要施加多少本身就是一個需對驗證集調校的超參數:太少會過擬合,太多會欠擬合。

正則化沒有免費的午餐:每種技術都對「簡單」是什麼做了某種假設(平滑函數、稀疏權重、批次不變性),若該假設對你的任務是錯的,它可能有害。正確的量與種類是經驗性的,要在驗證集上選擇,並非放諸四海皆準。

又稱
explicit and implicit regularization