多模態與視覺語言
Flamingo 閘控跨注意力
Flamingo 的閘控跨注意力,是讓一個凍結的預訓練語言模型開始「讀圖」卻不忘「寫字」的技術。Flamingo 不把視覺詞元塞進提示,而是在既有的凍結語言層之間,穿插全新的跨注意力層,這些新層讓文字去關注由 Perceiver 式重採樣器產生的固定大小視覺特徵集合。凍結骨幹保住了全部語言能力,新層則加上了「視覺」。
關鍵細節在於那道閘。每個插入的跨注意力與其前饋網路,都被乘上一個初始化為零的 tanh 閘控純量,於是訓練起始時視覺層是隱形的,模型表現得與原始語言模型一模一樣。隨訓練推進,閘平滑地打開,讓視覺資訊緩緩匯入,避免了在凍結網路中驟然插入新層所造成的失穩衝擊。注意力遮罩還確保每個文字詞元只關注它之前出現的影像,這正是支援圖文交錯序列與少樣本提示的機制。
這個設計首次讓少樣本多模態的脈絡內學習在大規模上奏效,至今仍是「想保住骨幹時為凍結語言模型添加模態」的範本。代價是跨注意力層增添了大量參數,以及由重採樣器設定的固定視覺詞元預算。
此處可重用的點子是「零初始化 tanh 閘控」:它讓你把新能力嫁接到凍結網路上,同時保證起始行為不變。
又称
另见