數據與特徵
資料集(dataset)
/ DAY-tuh-set /
資料集就是為了讓機器從中學習而收集起來的一堆例子——很像學生在真正考試前要研讀的一疊往年試卷。每個例子是一列:一棟房子連同它的面積、地段和成交價;一封被標註為垃圾郵件與否的郵件;一張照片連同它所描繪之物的名稱。這些例子的整體集合,就是資料集。
再看仔細些,資料集通常是一張表。每一列是一個實例(一次觀測),每一欄是一個特徵(feature)——也就是可度量的屬性,比如建築面積或像素亮度。在監督式學習中,有一欄特殊的欄叫標籤(label),即我們希望機器預測的答案。資料集也會以不那麼整齊的形態出現:一個裝滿圖片的資料夾、一堆文字文件、一串感測器讀數。但歸根結底,它們都可以歸結為「例子」加上「描述這些例子的屬性」。
為何重要:模型的好壞,至多只能和它見過的例子一樣好。如果資料狹窄、陳舊或有偏,模型就會繼承這些缺陷——它只能從被展示過的東西裡去舉一反三。從業者會極其在意一個資料集是怎樣採集的、它代表了誰或代表了什麼、又悄悄遺漏了什麼,因為這些抉擇會左右模型此後做的一切。更大的資料集並不自動等於更好的資料集;找對例子,比單純堆數量更要緊。
一個垃圾郵件過濾器的資料集,也許是一張包含5萬封郵件的表。每一列是一封郵件;各欄存放詞頻、寄件網域等特徵;最後一欄是標籤——「垃圾」或「非垃圾」——由人工逐封分揀後填上。
把資料集看作一張表:列是例子,欄是特徵,其中一欄是標籤。
資料多不等於資料好。一個系統性地低估了某些群體或情形的資料集,會造就一個在那裡悄悄失靈的模型——再聰明的演算法,也無法把例子裡根本不存在的資訊補回來。
又稱
另見