Transformer 引擎
前饋網路(feed-forward network, FFN)
如果說注意力是詞元彼此交談的地方,那前饋網路就是每個詞元坐下來自己思考的地方。當一個詞元從鄰居那裡收集完脈絡後,前饋網路便孤立地處理這個詞元——同一個小網路獨立地套用在每個位置上。它不做跨序列的混合;它只是把每個詞元的向量轉換成更有用的東西。
這個區塊是個小型的兩層感知器:先把詞元向量擴展到寬得多的隱藏維度,通常寬四倍,套上一個非線性的激發函數,再投影回原本的大小。那個寬寬的中間層,藏著模型出乎意料多的知識——許多事實性的關聯,表現得就像存在這些權重裡的鍵值記憶。事實上,前饋層通常佔了大型語言模型大部分的參數。
由於前饋網路對每個詞元的運作方式都一樣,它很容易平行化、也很容易擴展。它也是加入混合專家(mixture-of-experts)的自然位置:不再用單一個共用網路,而是把每個詞元導向少數幾個專門化的前饋網路,在不增加每個詞元成本的情況下擴增容量。
又称
另见