卷積網路架構

AlexNet

AlexNet 是點燃現代深度學習時代的架構。在 2012 年的 ImageNet 大規模視覺辨識挑戰賽(ILSVRC)中,由 Alex Krizhevsky 與 Ilya Sutskever、Geoffrey Hinton 設計的一個 CNN,把 top-5 分類錯誤率從約 26%(當時最佳的傳統電腦視覺流程)降到約 15.3%,這個差距大到在一年之內幾乎整個領域都放棄了人工設計的特徵,轉向深度 CNN。這個教訓不是某個單一聰明技巧,而是證明了:一個夠大的 CNN,在夠大的標註資料集上(120 萬張影像、1000 個類別)、配上足夠的算力訓練,其表現就是遠遠勝過先前的一切。

在結構上,AlexNet 是一個放大、加深版的 LeNet:五個卷積層(其中一些後接最大池化)餵入三個全連接層,最後以 1000 路 softmax 結尾,總共約六千萬個參數。有幾項工程選擇讓訓練這樣的網路首次變得可行。它以不飽和的 ReLU(修正線性單元,輸入為正則輸出該值、否則為零)取代了會飽和的 tanh/sigmoid,訓練速度快上數倍,因為對於大的正輸入其梯度不會消失。它在全連接層使用 dropout,在訓練時隨機把一半的激活值歸零以對抗過擬合。它施加大量資料擴增(隨機裁切、水平翻轉、色彩抖動)來倍增有效資料量。而且它把模型拆分到兩顆 GPU 上,因為單顆 3 GB 的 GTX 580 容不下它,這是 GPU 訓練為實務前進道路的早期證明。

AlexNet 也推廣了局部反應正規化(local response normalization,一種如今大致已被棄用的跨通道側向抑制)與重疊式最大池化。雖然 ReLU、dropout、卷積等個別元件都早於它存在,但 AlexNet 是把它們大規模結合、並在一個困難的公開基準上證明此組合具壓倒性的工作。它真正的遺產在技術之外也具社會學意義:它說服了業界與學界把資源投入深度學習,直接促成了緊接其後數年的 VGG、GoogLeNet 與 ResNet,並播下了最終孕育出 transformer、CLIP 與擴散模型(diffusion model)那整波浪潮的種子。

一個常見誤解是 AlexNet 發明了 ReLU、dropout、卷積或 GPU 訓練。它並未發明其中任何一項;它的貢獻在於把它們組裝成單一的深度網路,並在一個重要的公開基準上以決定性的差距獲勝,正是這一點讓整個領域相信了深度學習。