深度学习
卷积神经网络(convolutional neural network)
卷积神经网络(简称 CNN)是一种让计算机「看见」东西的人工大脑。它不会一口气盯着整张照片,而是把一个小窗口——一块小小的滤镜——滑过图像,一次只看一小块,就像你拿放大镜在地图上一格格地扫。每块滤镜只专门捕捉一样简单的东西:一道斜边、一抹颜色、一段弧线。
巧妙之处在于把这些层叠起来。第一层找出朴素的边缘;下一层把边缘拼成转角和纹理;再上一层把它们组装成眼睛、车轮或花瓣;最顶层终于说出「猫」或「停车标志」。从最底层一步步搭起来,简单的零件变成丰富的形状,再变成完整的物体——而网络靠着在数百万张带标签的图片上反复练习,自己学会该用哪些滤镜。
一个常见的担忧是:CNN 会不会把训练用的照片原样「背」下来。多半不会:因为同一块小滤镜会在图像的每一处反复使用,网络倾向于学到放在哪里都管用的模式——一张脸就是一张脸,无论它在画面的角落还是正中央。但「死记硬背」(也就是「过拟合」)仍然可能发生,这正是训练要用海量、多样的数据集的原因。正是这种善于提炼可复用模式的本领,让 CNN 成了计算机视觉的主力,从手机相机到医学影像,背后都有它。
把一个 3×3 的边缘检测滤镜滑过一张猫的照片——它会在每根胡须和耳朵的轮廓上亮起来,而对中间平整的毛皮无动于衷。
同一块滤镜,滑遍每一处,搜寻同一种简单图案。
「卷积」就是把滤镜滑过图像、再把重叠部分相加的那个数学运算。现代 CNN 的爆发始于 2012 年,一个名叫 AlexNet 的网络在图像识别比赛中大获全胜,掀起了深度学习的浪潮——不过其核心思想可追溯到杨立昆(Yann LeCun)在 1980、90 年代用来识别手写数字的网络。
又称
另见