現代大型語言模型架構內部
均方根正規化(RMSNorm)
很深的層堆疊會讓激活值爆增或縮向零,所以每個區塊都先把輸入重新縮放到合理大小。RMSNorm 用最輕的手法做到這件事:把每個向量除以它自己的均方根大小,再乘上一個逐特徵學得的增益。可以把它想成一個音量旋鈕,在這一層動工之前,先把每個詞元表示的響度重設到一個固定水準,而完全不理會平均值。
它是精簡版的 LayerNorm。經典 LayerNorm 會減去平均值再除以標準差;RMSNorm 把減平均與偏置整個拿掉,只留下縮放。實務上這個省略幾乎不影響品質,卻節省了計算且數值上更單純,這正是當前多數大型語言模型採用 RMSNorm 的原因。它和「位置」問題相伴:幾乎所有現代模型都把正規化放在注意力與前饋子層之前,而非之後。
\mathrm{RMSNorm}(x) = \frac{x}{\sqrt{\frac{1}{d}\sum_i x_i^2 + \epsilon}}\odot g
除以均方根大小,再乘上學得的增益 g;不減去平均值。
又称
另见