多模態與視覺語言

跨模態注意力

跨模態注意力是 transformer 內部讓兩股資訊(比方一個句子和一張圖片)真正彼此「對話」的機制。它不讓每個詞元只關注同類,而是查詢來自一個模態、鍵與值來自另一個模態,於是一個詞能跨過去、精準蒐集解釋它的那些影像補丁,而一個區域也能拉進命名它的那些詞。這就是把兩個分開的表示融合成單一接地理解的那一步。

在機制上,它就是普通的縮放點積注意力,只是查詢、鍵、值取自不同來源:文字查詢去關注視覺特徵,或由可學習的潛在查詢同時關注兩者。它以多種面貌出現——早期 VLP 編碼器的協同注意力區塊、Flamingo 插入凍結語言模型的閘控跨注意力層、以及 Q-Former 用來讀取凍結視覺編碼器的跨注意力。「誰提供查詢、誰提供鍵」的不對稱性是一個設計選擇,決定了哪個模態以哪個模態為條件。

跨模態注意力比單純把特徵串接、再讓自注意力自己理清更具表達力,但它也是虛假對齊悄悄滲入之處:在弱監督下,模型可能關注錯誤區域卻仍產出流暢文字,因此注意力圖是個誘人卻不可靠的接地解釋。

又称
跨模態注意力cross-attention fusion