计算机视觉

图像分类(image classification)

/ IM-ij klas-uh-fih-KAY-shun /

图像分类向机器提出一个直白的问题:这是什么?你递给它一张照片,它从一个固定的清单里返回一个标签——「猫」「金毛寻回犬」「停车标志」。它不告诉你猫在哪里、有几只、或猫在做什么;它只是为整张图挑一个最合适的名字。这是计算机视觉里最简单、最古老的任务,而大多数其他视觉任务都建立在它之上。

在内部,机器从来没看见过「猫」——它看到的是一格一格的亮度数字,每个像素三个,分别对应红、绿、蓝。所谓训练,就是给它看几十万张带标签的照片,让它一点点学会:哪些边缘、纹理与形状的组合,往往对应哪个标签。它的输出通常不是简单的「是」或「否」,而是一串置信度:92%是猫、5%是狐狸、3%是狗。我们取最高的那个当答案,但那92%只是一次统计上的押注,并不代表它真的「懂」。

这里值得对失败方式保持诚实。分类器的好坏,不会超过它训练时用过的类别和例子。如果它的清单里只有动物,你拿一只咖啡杯给它看,它会自信地把杯子叫成最接近的那种动物。光线、角度或一张贴纸都可能骗倒它;它还常常抓住背景里的「捷径」——一个从绿色田野照片里学会「牛」的模型,碰到海滩上的牛可能就栽了。在基准测试上的高准确率,和在真实世界里可靠的判断,并不是一回事。

你上传一张自家虎斑猫的照片。分类器返回:猫0.94、猞猁0.03、狐狸0.02、其他0.01。应用显示「猫」。把同一张照片裁剪到只剩地毯,它现在可能猜「门垫0.40」——它再也看不到猫,却仍然必须选个东西出来。

为整张图给出一个标签,以置信度形式呈现。即便没有合适的对象,分类器也总会挑出一个。

分类器输出的是一个封闭类别清单上的概率,且必须加起来等于一,所以它永远答不出「都不是」。任何真正落在它训练清单之外的东西,都会被硬塞进最接近的已知标签——既自信又错误。识别这类「清单之外」的输入,是另一个更难的问题。

又称
image recognition图像识别图片分类圖像辨識