以資料為中心的人工智慧
長尾資料處理(long-tail data handling)
真實世界的資料服從長尾分布:少數頭部類別樣本充裕,而一長串罕見類別各只有寥寥幾個。直接訓練的模型會精通常見案例,卻對罕見案例近乎全盲——然而罕見案例(一種少見疾病、一種詐欺樣式、一個邊緣物件)往往正是最要緊的那些。長尾處理就是一套在不毀掉頭部的前提下、把尾部準確率救回來的技術。
這些介入落在三個層級。資料層方法做重抽樣:對尾部類別過抽樣(並合成變體)、對頭部欠抽樣,或對尾部做資料擴增。損失層方法做重新加權:用有效樣本數的類別平衡損失、依對數先驗移動決策邊界的 logit 調整、以及對較罕見類別強制更大邊際的邊際損失(LDAM)。表徵層方法把特徵學習與分類器解耦——在自然分布上學特徵,再只對最後的分類器重新平衡——因為骨幹往往學得不錯,是分類器偏向了頭部。對基礎模型而言,檢索與少樣本遷移讓尾部知識搭上廣泛預訓練的順風車。
誠實的張力是頭尾權衡:激進的重新平衡能拉高罕見類別的召回,卻可能拖累整體準確率與校準,因此正確的操作點取決於每種錯誤類型的真實代價。
解耦常勝過端到端重新平衡——骨幹在自然分布上學得好,偏掉的是分類器那一頭。
又称
另见