深度學習
卷積神經網路(convolutional neural network)
卷積神經網路(簡稱 CNN)是一種讓電腦「看見」東西的人工大腦。它不會一口氣盯著整張照片,而是把一個小視窗——一塊小小的濾鏡——滑過影像,一次只看一小塊,就像你拿放大鏡在地圖上一格格地掃。每塊濾鏡只專門捕捉一樣簡單的東西:一道斜邊、一抹顏色、一段弧線。
巧妙之處在於把這些層疊起來。第一層找出樸素的邊緣;下一層把邊緣拼成轉角和紋理;再上一層把它們組裝成眼睛、車輪或花瓣;最頂層終於說出「貓」或「停車標誌」。從最底層一步步搭起來,簡單的零件變成豐富的形狀,再變成完整的物體——而網路靠著在數百萬張帶標籤的圖片上反覆練習,自己學會該用哪些濾鏡。
一個常見的擔憂是:CNN 會不會把訓練用的照片原樣「背」下來。多半不會:因為同一塊小濾鏡會在影像的每一處反覆使用,網路傾向於學到放在哪裡都管用的模式——一張臉就是一張臉,無論它在畫面的角落還是正中央。但「死記硬背」(也就是「過擬合」)仍然可能發生,這正是訓練要用海量、多樣的資料集的原因。正是這種善於提煉可重複使用模式的本領,讓 CNN 成了電腦視覺的主力,從手機相機到醫學影像,背後都有它。
把一個 3×3 的邊緣偵測濾鏡滑過一張貓的照片——它會在每根鬍鬚和耳朵的輪廓上亮起來,而對中間平整的毛皮無動於衷。
同一塊濾鏡,滑遍每一處,搜尋同一種簡單圖案。
「卷積」就是把濾鏡滑過影像、再把重疊部分相加的那個數學運算。現代 CNN 的爆發始於 2012 年,一個名叫 AlexNet 的網路在影像辨識比賽中大獲全勝,掀起了深度學習的浪潮——不過其核心思想可追溯到楊立昆(Yann LeCun)在 1980、90 年代用來辨識手寫數字的網路。
又稱
另見