数据与特征
数据增强(data augmentation)
/ DAY-tuh awg-men-TAY-shun /
数据增强,是指通过对已有的例子施加一些细小的、不改变标签的改动,来创造出额外的训练例子。一张猫的照片,把它左右翻转、旋转几度、调亮一点、或稍微放大,它仍然是一只猫。让模型见到这一切变体,你就教会了它:无论姿态或光照如何,猫就是猫——而无需花钱去标注哪怕一张新图。
关键的约束是:那个变换绝不能改变正确答案。对图像:翻转、旋转、裁剪、颜色偏移、加噪声。对音频:改变速度或音高、混入背景声。对文本:把词换成同义词,或经由另一种语言来回翻译(回译)。每一处改动,都给了模型同一个底层事物的又一个如实例子,取自它在真实世界里将会遇到的多样性。
为何重要:数据增强是对抗过拟合、提升泛化能力最有效也最廉价的办法之一,尤其在标注数据稀缺时。它之所以管用,是因为它把你已知为真的不变性烤进了数据(一只侧身的猫仍是猫),好让模型不再死盯无关的偶然细节。但它有其限度:它只能把你已有的数据拉伸开来,而无法凭空捏造出真正全新的情形;而一处粗心的变换还可能悄悄翻转标签——把数字6的照片旋转180度,就成了9,反倒教给了模型一件假事。
从一张已标注的停车标志照片出发,增强会生成十几张训练图像:略微旋转的、部分阴影的、从某个角度看的、有点模糊的、更亮的、更暗的。自动驾驶模型于是学会了在真实街道的种种杂乱条件下认出停车标志,而不只是认得那唯一一张完美无瑕的快照。
一个标签,许多如实的变体——教会模型「什么是不变的」。
增强必须保住标签。一个把6变成9的旋转,或一个把熟番茄染成绿色的颜色偏移,都在教给模型一个谬误——务必检查:你的改动之后,正确答案是否依然正确。
又称
另见