以資料為中心的人工智慧
資料卡與資料集文件(data cards and dataset documentation)
資料卡是貼在資料集側面的結構化標籤:一份標準化文件,記錄資料從何而來、如何收集與標註、內含什麼、以及該與不該用來做什麼。背後的類比是電子元件附帶的規格表——你不會在沒看規格表的情況下把晶片焊進電路,然而資料集長期以來什麼都不附,逼下游使用者用慘痛代價重新發現它的怪癖與危害。
這個體裁由《Datasheets for Datasets》(Gebru 等人)與《Data Cards》(Google)確立,如今也以 Hugging Face 的 dataset card 與 croissant 詮釋資料形式出現。一張完整的卡回答一份固定檢查表:動機與資金、組成(樣本、欄位、切分、缺失資料)、收集流程與同意、前處理與清理、建議與不建議的用途、散布與授權、以及維護。關鍵是它把敏感屬性、已知偏誤與母體涵蓋度攤開,讓建模者能在訓練前判斷它是否適合自己的情境。
文件是治理的基礎建設,而非一個指標:它不會修好一份有瑕疵的資料集,但它讓瑕疵變得可讀、可稽核、可引用,而且日益成為法規遵循與可重現性的必要條件。
資料卡記錄瑕疵,但不會移除它們——把它讀作「是否適用」的揭露,而非品質保證。
又稱
另見