弱監督(weak supervision)
/ WEEK soo-per-VIZH-un /
把一百萬個例子一個一個手工標註,又慢又貴。但你常常能寫出一些又快又糙的規則,把其中大多數判對:「如果一封郵件含有『緊急電匯』這個說法,它八成是詐騙。」規則並不完美,卻便宜,而且你能瞬間把它套到所有資料上。弱監督,就是用便宜而帶雜訊的標籤——而非稀缺而完美的標籤——來訓練模型的做法。
弱標籤有好幾種樣子:規則與啟發式(「含『發票』一詞 → 財務」)、拿現成資料庫充當「真值」的替身、不夠精確的標籤(我們知道照片裡某處有隻貓,卻不知在哪)、或來自非專家或別的模型的標籤。每個來源單看都不可靠。關鍵的點子,是把許多弱的、彼此重疊、相互矛盾的來源做統計上的合併——為每個來源該信幾分、它們之間如何相關建立模型——從而產出一批機率性的「最佳猜測」標籤,好得足以用來訓練一個真正的模型。
它是務實的、以資料為中心的機器學習的一根頂梁柱,因為它讓一支小團隊能在幾個鐘頭、而非幾個月裡標完龐大的資料集,也讓領域專家能以規則的形式注入知識,而不必沒完沒了地手工打標。坦白說說它的邊界:這些標籤確實帶雜訊,所以你規則裡的盲點和系統性錯誤,會被一併烤進模型裡。弱監督在許多獨立來源能彼此糾錯時效果最好;一旦它們都帶著同一種偏見,模型就會原封不動地繼承下來。
為了不靠手工標註就造出一個垃圾郵件過濾器,團隊寫了十幾條粗糙的規則——指向已知惡意網域的連結、全大寫的主題行、某些特定說法。每條規則都時不時出錯,彼此也不一致。一個弱監督模型給它們加權、合併,為一百萬封郵件產出機率性的標籤,而用這些標籤訓練出來的分類器,足以與靠昂貴的手工標籤造出來的相媲美。
許多便宜又不完美的規則,合併成可用的標籤。
弱監督是用標籤品質換標籤數量。當許多獨立來源能彼此糾錯時它最出彩——可一旦它們共享同一個盲點,模型就會原封不動地繼承那個錯誤。