以資料為中心的人工智慧
資料集蒸餾(dataset distillation)
資料集蒸餾把整個訓練集壓縮成少數幾個合成樣本——常常每類只有一個或幾個——使得從頭在這些合成點上訓練的模型,能達到接近用全資料訓練的準確率。與只抽取真實樣本的核心集不同,蒸餾出的影像或 token 序列是被最佳化出來的人造物;它們可能看起來像許多真實影像疊出的幽靈,且不必像任何單一一張。
它被表述為雙層最佳化:內層在這個小合成集上訓練模型參數,外層調整合成資料,使內層訓練後在真實資料上的損失最小。由於對整段內層訓練微分代價高昂,實務方法改用代理——梯度匹配(讓合成資料每步的梯度模仿真實資料的梯度)、軌跡匹配(對齊參數路徑)、特徵空間中的分布匹配,或核嶺迴歸的閉式解(KIP)。這個合成集,加上有時一併學到的軟標籤與學習率,就是蒸餾出的資料集。
應用包括快速神經架構搜尋、用極小重播緩衝區做持續學習、以及帶隱私意味的資料分享。誠實的限制是:蒸餾集是針對某個模型類別調的,跨架構會退化;擴展到高解析度與多類別仍然困難;而所謂「隱私」是經驗性的,並非形式上的保證。
蒸餾出的影像是被最佳化的人造物,而非具代表性的真實樣本——它可能編碼了任何單張訓練影像都不帶有的訊號。
又称
另见