機器學習
標籤(label)
/ LAY-bul /
標籤,是貼在一個例子上的正確答案——也就是你想讓機器學會去預測的那個東西。如果你給程式看成千上萬張照片,並告訴它哪些裡頭有貓,那麼釘在每張照片上的「貓」或「無貓」就是它的標籤。它是記憶卡片的背面:輸入是問題,標籤是機器學習時用來對照、給自己打分的答案。
標籤有不同的形態。它可以是一個類別,比如「垃圾郵件」或「非垃圾郵件」(用於分類);也可以是一個數值,比如明天的氣溫(用於迴歸)。標籤從哪兒來,關係極大。大多數標籤是人一個一個標出來的——一項又慢又費錢的活,叫資料標註。也有些標籤由世界本身免費送上門來:顧客究竟點沒點那個連結、病人有沒有康復。這些天然的結果,往往是所有標籤中最可信的。
誠實地說,模型的上限就是標籤的品質。如果標籤本身錯了、前後不一致,或帶著偏見,機器就會忠實地把這些錯誤學進去——垃圾進,垃圾出。對同一個例子,兩個人甚至可能對正確標籤爭執不下(那條評論是正面的,還是只是在反諷?),而這種與生俱來的分歧,給任何模型所能達到的準確度都設了一個天花板。許多任務根本沒有標籤——這正是非監督式學習所要應對的局面。
一個團隊想從 X 光片裡檢出腫瘤。放射科醫師逐一審閱 5 萬張片子,給每張標上「有腫瘤」或「正常」。這些標記就是標籤。當兩位醫師對一張模稜兩可的片子各執一詞時,那一個含糊的標籤,就悄悄限定了最終模型能好到什麼程度。
標籤是標準答案——而人對標籤的分歧,給模型的準確度封了頂。
「標籤」通常意味著監督式學習——每個例子都附帶答案。許多 AI 專案裡最貴的部分往往不是算力,而是費心費力地產出準確標籤的人工。
又稱
另見