生成式視覺:擴散與文生圖
交叉注意力條件
交叉注意力條件是讓文字真正伸進影像、塑造影像的機制。在去雜訊 U-Net 內部,當模型建立起描述「進行中影像」的特徵之後,交叉注意力讓那張影像的每一個空間位置都能去「查閱」文字嵌入,並問:「哪些字與我相關?它們該如何改變我是什麼?」將會變成狗的區域會強烈地關注 token「狗」;將會變成天空的區域會關注「藍色」與「天空」。這種「依位置、依內容」地把文字語意路由進空間特徵的做法,正是讓提示詞能導引構圖、而不只是設定一個全域氛圍的原因。
注意力運作於三個角色:查詢(query)、鍵(key)與值(value)。在交叉注意力中,查詢來自影像特徵(每個空間位置產生一個查詢向量),而鍵與值來自文字嵌入——這正是「交叉」之所在(一個來源去關注另一個不同的來源),相對於自注意力中三者皆來自影像。對每個影像位置,模型計算其查詢與每一個文字鍵之間的相似度(內積),用 softmax 把這些相似度正規化成注意力權重,再回傳文字值的加權總和。那個回傳的向量被加回影像特徵中,把相關的文字資訊正好注入到需要它的地方。
交叉注意力層在 U-Net 中於多個解析度交錯分布,因此文字引導同時作用於粗略佈局與精細細節。這種設計也是文生圖模型如此易於編輯的原因:注意力圖揭示了每個字控制哪些影像區域,使得諸如「提示對提示」編輯(改一個字,只替換那個字所掌管的區域)與基於注意力的定位等技術成為可能。它是文生圖系統中語言與視覺兩半之間,單一最重要的架構橋樑。
對提示詞「一隻戴著紅帽子的貓」,把 token「帽子」的交叉注意力圖視覺化:它恰好在浮現中的貓的頭部區域亮起,而「紅色」也在同一塊區域亮起——顯示模型已在空間上把顏色綁定到了物件上。當綁定失敗時,你可以實際看到「紅色」關注到了錯誤的區域。
又称