數據與特徵

合成資料(synthetic data)

/ sin-THET-ik DAY-tuh /

合成資料,是人工生成、用來替代真實資料的資訊。你不去從世界裡採集更多記錄,而是製造出貌似可信的新記錄——藉助一個模擬器、一套統計規則,或一個已經學會「真實例子長什麼樣」的生成模型。不妨想想飛行模擬器:它能造出逼真的飛行體驗,而無需任何人離開地面。

它的生成方式有好幾種。一個物理模擬器可以從各個角度渲染出某個零件上百萬張帶標籤的圖像。一個在真實病歷上訓練過的生成模型,能吐出虛構卻在統計上相似的病人。簡單的規則可以編造出遵循已知模式的交易。關鍵在於,合成資料可以自帶標籤——模擬器精確知道它畫的是什麼——這就完全繞開了緩慢而昂貴的人工標註環節。

為何重要:當真實資料稀缺、昂貴、危險或涉及隱私時,合成資料便大放異彩。它讓你能在等不及的罕見事件上訓練(自動駕駛汽車演練撞車)、在不暴露真人的前提下共享資料,並平衡一個罕見類別。但天下沒有免費的午餐:合成資料只能反映它據以構建的假設或訓練資料,因此可能錯過現實中那些雜亂的意外——這道鴻溝叫做「模擬到現實的差距」(sim-to-real gap)。純靠合成資料訓練的模型,往往仍需真實資料來微調和驗證,而且你絕不能想當然地以為合成資料和真東西一模一樣。

一個機器人團隊在一個類似電子遊戲的模擬器裡訓練倉庫機器人,生成數百萬個標註完美的場景——各種角度、各種光照下的箱子——這些場景在現實裡拍上幾年也拍不完。隨後,機器人會在真實貨架上練習一個小時,以彌合乾淨的模擬與雜亂的倉庫之間的差距。

數百萬個免費、標註完美的模擬場景——再來一次現實校驗。

合成資料會繼承產生它的那個東西的盲點。如果你的模擬器或生成器從未設想過某種情形,你的合成資料裡就不會有它——一個只用它訓練的模型,對真實世界會是自信卻毫無準備的。

又稱
artificial datagenerated datafake data合成数据合成資料人造資料