以資料為中心的人工智慧
核心集選取(coreset selection)
核心集是一小撮經過巧妙加權的資料子集,挑選的目標是:在它上面訓練得到的模型,幾乎等同於用全部資料訓練的結果。畫面像一份重點筆記:與其把整本教科書重讀一遍,你只留下幾頁有代表性的內容,其加權總和在「通過考試」這件事上的表現就像整本書。它承諾的是大幅省下計算,同時對損失多少有可證明的上界。
經典保證是幾何式的:挑出子集與權重,使每個樣本損失梯度的加權和,在某區域內對每個參數都與全資料梯度相差不超過 ε,於是在核心集上做梯度下降,會緊跟在全資料上做梯度下降。方法包括以梯度範數或敏感度做重要性抽樣、為涵蓋度做貪婪次模最大化、特徵空間中的 k-center 分群,以及如 CRAIG、GradMatch 的梯度匹配目標。權重與選取同等重要——它修正抽樣偏誤,使這個小集合成為全目標的無偏、低變異估計。
核心集在需要反覆訓練的場景(超參數搜尋、持續學習)與主動學習預算下特別出色。提醒是:這個界是相對某個模型類別與區域的局部保證;在非凸深度網路與分布偏移下保證會變弱,且為某架構調好的核心集未必能轉移到另一個架構。
\Big\| \sum_{i \in C} w_i \,\nabla \ell_i(\theta) - \sum_{j \in D} \nabla \ell_j(\theta) \Big\| \le \varepsilon \quad \forall \theta \in \Theta
梯度匹配的核心集條件:加權子集的梯度在參數區域內,與全梯度相差不超過 ε。
拿掉權重,核心集就只是個有偏的小樣本——重新加權才讓估計變無偏。
又稱
另見