數據與特徵
資料標註(data annotation)
/ DAY-tuh an-oh-TAY-shun /
監督式學習需要有答案才能學習,而這些答案很少是憑空白來的——通常得有人把它們附上去。資料標註(或稱打標籤),就是給原始資料標上正確答案的這份工作:在照片裡給每個行人畫框、把一條推文標為正面或負面、把一段錄音轉成文字、在掃描影像上標出腫瘤。它是模型所模仿的、由人類提供的真相。
標註從輕快到艱辛不一而足。簡單的任務是每條目點一下(垃圾與否);困難的可能要一位放射科醫生逐像素勾勒出器官。由於這些標籤成了模型對「正確」的定義,它們的品質就是一切。標註員之間會有分歧、會疲倦、會誤讀規範,所以正經的專案會測量標註者間一致性(獨立的標註者說法相同嗎?)、撰寫細緻的說明,並讓多人標註同一批條目,以發現並化解衝突。
為何重要:標籤往往是一個機器學習專案裡最昂貴、最緩慢、也最不動聲色地舉足輕重的部分。如果標籤嘈雜或有偏,模型就會忠實地學到那份雜訊或偏見——沒有哪種演算法能修好「它被告知為對、實則為錯」的答案。正因如此,如今才有大量精力投向降低標註成本(主動學習:讓模型只針對它覺得最困惑的那些例子來索要標籤),以及審查標籤品質——這正是資料中心AI的核心。
為訓練自動駕駛汽車的視覺系統,標註員要在數十萬張街景照片裡,給每一輛車、每一位騎車人和每一名行人畫上緊貼的框。每張圖由兩個人標註;遇到一位半遮半掩、難以判斷的騎車人時,若兩人意見不一,便由第三位審核者裁定——而這份審慎得來的一致,就成了模型要學習的真相。
兩位標註者,一位裁判——製造出模型將要模仿的那份「真相」。
標籤被當作「黃金標準」只是約定俗成,而非天經地義。它們承載著製作者的判斷、疲憊與偏見——所以一個模型的可靠程度,永遠不可能超過它訓練時所用的標籤。
又稱
另見