數據與特徵
資料擴增(data augmentation)
/ DAY-tuh awg-men-TAY-shun /
資料擴增,是指透過對已有的例子施加一些細小的、不改變標籤的改動,來創造出額外的訓練例子。一張貓的照片,把它左右翻轉、旋轉幾度、調亮一點、或稍微放大,它仍然是一隻貓。讓模型見到這一切變體,你就教會了它:無論姿態或光照如何,貓就是貓——而無需花錢去標註哪怕一張新圖。
關鍵的約束是:那個變換絕不能改變正確答案。對圖像:翻轉、旋轉、裁剪、顏色偏移、加雜訊。對音訊:改變速度或音高、混入背景聲。對文字:把詞換成同義詞,或經由另一種語言來回翻譯(回譯)。每一處改動,都給了模型同一個底層事物的又一個如實例子,取自它在真實世界裡將會遇到的多樣性。
為何重要:資料擴增是對抗過擬合、提升泛化能力最有效也最廉價的辦法之一,尤其在標註資料稀缺時。它之所以管用,是因為它把你已知為真的不變性烤進了資料(一隻側身的貓仍是貓),好讓模型不再死盯無關的偶然細節。但它有其限度:它只能把你已有的資料拉伸開來,而無法憑空捏造出真正全新的情形;而一處粗心的變換還可能悄悄翻轉標籤——把數字6的照片旋轉180度,就成了9,反倒教給了模型一件假事。
從一張已標註的停車標誌照片出發,擴增會生成十幾張訓練圖像:略微旋轉的、部分陰影的、從某個角度看的、有點模糊的、更亮的、更暗的。自動駕駛模型於是學會了在真實街道的種種雜亂條件下認出停車標誌,而不只是認得那唯一一張完美無瑕的快照。
一個標籤,許多如實的變體——教會模型「什麼是不變的」。
擴增必須保住標籤。一個把6變成9的旋轉,或一個把熟番茄染成綠色的顏色偏移,都在教給模型一個謬誤——務必檢查:你的改動之後,正確答案是否依然正確。
又稱
另見