多模態與視覺語言
Q-Former(查詢式 transformer)
Q-Former 是 BLIP-2 放在凍結影像編碼器與凍結語言模型之間的輕量橋樑,讓這兩個從未一起訓練過的巨人得以合作。它帶著一小組可學習的查詢向量(約三十二個),這些查詢跨注意力進入凍結的視覺特徵,再從另一端輸出成一束精簡的詞元,以語言模型讀得懂的形式概括影像。只有這個小模組會被訓練,使得打造一個有能力的 VLM 變得相當便宜。
它是一個小型 transformer,其查詢在兩個階段身兼二職。第一個表示學習階段,在凍結影像特徵上以三個目標同時訓練——圖文對比配對、以影像為基礎的文字生成、圖文配對判斷——共享同一組查詢詞元,但對每個目標施以不同的注意力遮罩,使查詢學會抽取「與語言相關」的視覺資訊。第二階段,它的輸出查詢經線性投影後接到語言模型輸入前端,作為軟性視覺提示,此時只微調 Q-Former 與該投影。
這種查詢式設計是 Perceiver 潛在瓶頸與 Flamingo 重採樣器的直系後代:固定且少量的查詢,把語言模型的成本與影像解析度解耦。它的限制恰恰也來自這種壓縮——三十二個詞元無法保留密集文字或精細的空間細節,這正是後來的 VLM 常捨棄它、改用較高解析度補丁投影的原因。
又称
另见