以資料為中心的人工智慧
資料混合比最佳化(data mixture optimization)
預訓練語料是多個領域的混合——網頁文字、程式碼、書籍、百科文章、數學。混合權重決定每個領域要佔多少比例的訓練 token。這些權重極其關鍵:程式碼太少模型就不會寫程式,狹窄的網頁文字太多又會失去通用知識。資料混合比最佳化,就是為你的目標挑出這些抽樣比例的問題,而不是照搬網路恰好提供的自然比例。
已有幾種有原則的做法。群組分布穩健最佳化(DRO)與 DoReMi 訓練一個小型代理模型,找出能最小化各領域最壞情況超額損失的權重,其理論是:保護最難的領域能得到穩健的通用模型。另一些方法擬合一個尺度律代理,把驗證損失預測成混合權重與 token 預算的函數,再對預測損失做最佳化;線上方法則在訓練中依各領域的學習訊號動態調整權重。輸出是領域單純形上的一個權重向量,有時會在訓練後段退火,讓高品質領域被上調。
難處在於最佳混合取決於模型大小、總 token 預算、以及你用哪些下游任務評分——沒有通用配方,而且代理模型得到的權重,未必能乾淨地轉移到全尺度的正式訓練。
\min_{w \in \Delta^{k}} \; \max_{d \in \{1,\dots,k\}} \big[ \mathcal{L}_{d}(\theta_w) - \mathcal{L}_{d}^{\star} \big]
DoReMi 式的極小極大:在單純形上選領域權重 w,最小化最差領域相對其參考的超額損失。
代理模型的混合權重是在小尺度上調的;務必在你真正訓練的規模上重新驗證它仍然有幫助。
又称
另见