计算机视觉

图像特征与边缘(image features and edges)

/ IM-ij FEE-churs and EJ-iz /

在机器能认出一张脸或一条路之前,它得先在原始的像素汪洋里找到可以抓住的东西。特征就是那些抓手:边缘(亮度的剧烈变化,比如深色屋顶与明亮天空相接处的那条轮廓线)、角点、斑块和纹理。边缘是最基本的特征——它标记出一条边界。角点,也就是两条边缘相交之处,则更有用,因为它很容易在另一张照片里重新找到。这些细小而独特的地标,就是拼写出更高层级识别的字母表。

几十年来,研究者手工设计出种种巧妙的配方来检测这些特征——你可能会遇到的名字包括Canny边缘检测器,以及SIFT、ORB这类关键点方法。其思路是把一张杂乱的照片浓缩成一组紧凑而稳定的地标,再在不同图像之间匹配这些地标。全景拼接就是这样把你的照片缝在一起的,手机也是这样追踪世界来实现增强现实的,更早的识别系统在深度学习之前也是这样工作的。

这里有一个诚实的历史转折。现代深度网络很少直接使用这些手工特征;它们改为从数据中学出自己的特征,而一个训练好的网络,其前几层最终往往会自己重新发现出边缘与角点检测器。所以这个概念,一半是奠基性的历史,一半仍是活生生的工程:当数据稀缺、当你需要速度与透明度、或者面对像「对齐两张照片」这样的几何任务(学得来的特征在此并无明显优势)时,手工特征依然有它的价值。

对一张肖像跑边缘检测器,照片就化成了黑底上的白线:脸的轮廓、眼镜的边框、头发的分缝——而平滑、色调均匀的脸颊则一片空白,因为平坦的区域里没有边缘可找。

边缘存在于亮度剧烈变化之处;平坦的区域则消失不见。它们是识别赖以建立的原始地标。

一个常见的误解,是以为深度学习让手工特征过时了。实际上,训练好的网络其前几层反正也会重新发明出边缘与角点检测器,而在低数据、低功耗,或像图像对齐这样的几何任务上,显式的特征仍然占优。这两种路子是表亲,而非对手。

又称
edge detectionfeature extractionkeypoints图像特征边缘检测邊緣偵測特徵點