数据与特征

合成数据(synthetic data)

/ sin-THET-ik DAY-tuh /

合成数据,是人工生成、用来替代真实数据的信息。你不去从世界里采集更多记录,而是制造出貌似可信的新记录——借助一个模拟器、一套统计规则,或一个已经学会「真实例子长什么样」的生成模型。不妨想想飞行模拟器:它能造出逼真的飞行体验,而无需任何人离开地面。

它的生成方式有好几种。一个物理模拟器可以从各个角度渲染出某个零件上百万张带标签的图像。一个在真实病历上训练过的生成模型,能吐出虚构却在统计上相似的病人。简单的规则可以编造出遵循已知模式的交易。关键在于,合成数据可以自带标签——模拟器精确知道它画的是什么——这就完全绕开了缓慢而昂贵的人工标注环节。

为何重要:当真实数据稀缺、昂贵、危险或涉及隐私时,合成数据便大放异彩。它让你能在等不及的罕见事件上训练(自动驾驶汽车演练撞车)、在不暴露真人的前提下共享数据,并平衡一个罕见类别。但天下没有免费的午餐:合成数据只能反映它据以构建的假设或训练数据,因此可能错过现实中那些杂乱的意外——这道鸿沟叫做「仿真到现实的差距」(sim-to-real gap)。纯靠合成数据训练的模型,往往仍需真实数据来微调和验证,而且你绝不能想当然地以为合成数据和真东西一模一样。

一个机器人团队在一个类似电子游戏的模拟器里训练仓库机器人,生成数百万个标注完美的场景——各种角度、各种光照下的箱子——这些场景在现实里拍上几年也拍不完。随后,机器人会在真实货架上练习一个小时,以弥合干净的模拟与杂乱的仓库之间的差距。

数百万个免费、标注完美的模拟场景——再来一次现实校验。

合成数据会继承产生它的那个东西的盲点。如果你的模拟器或生成器从未设想过某种情形,你的合成数据里就不会有它——一个只用它训练的模型,对真实世界会是自信却毫无准备的。

又称
artificial datagenerated datafake data合成数据合成資料人造資料