預訓練

資料配比加權(data mixture weighting)

預訓練語料是許多來源的混合——網路文字、書籍、程式碼、數學、維基百科、科學論文——而配比加權,就是決定模型實際上各看多少。它是「食譜」而非「食材」:你手上也許握著一兆詞元的程式碼,卻選擇只讓它占訓練的一成;同時把一小批高品質書籍加重,讓它的影響力超過原始的份量。

這些權重是有實際效果的調節旋鈕。更多程式碼通常能改善推理與結構化輸出;更多高品質文字能提升流暢度;更多多語文本能拓寬語言覆蓋。由於有些來源量小卻珍貴,常會在每一輪中被多次抽樣,而龐大的低品質來源則被降採樣。團隊會用小型的代理實驗與縮放律外推來挑權重,而不是憑空臆測。

難就難在:最佳配比取決於你想讓模型擅長什麼,而這些選擇彼此會互相取捨。課程式排序——先給較簡單或較乾淨的資料、較難的留到後面——是疊在這個靜態配比之上的相關手段。

又称
data mixingdomain weightingsampling proportions