多模態視覺語言

場景圖生成

場景圖生成(scene graph generation,SGG)是把一張影像摘要成一張「物件及其彼此關係」之圖的任務。每個被偵測到的物件成為一個節點(帶類別與框,例如「男人」「馬」「帽子」),每個有意義的關係成為一條有向邊,標上一個謂詞,寫成主詞—謂詞—受詞的三元組:「男人 騎 馬」「男人 戴 帽子」「馬 在 草地上」。其成果是一份精簡、結構化、機器可讀的描述,說明「誰對誰做了什麼」——超越「有哪些物件」而進到「它們如何相關」。

SGG 建立在物件偵測加關係預測之上。偵測出物件後,模型考慮成對的物件,並預測它們是否相關、如何相關——用兩個框、它們的相對幾何,以及視覺與語意特徵,來分類謂詞(空間型如「在上」「在下」,所屬型如「有」「穿戴」,或動作型如「騎」「吃」)。由於關係是依情境而定的,優良模型會在物件之間傳遞訊息(圖神經網路,或 MOTIFS 模型的觀察:光是物件標籤就能強烈預測可能的謂詞),於是整張圖是被聯合精煉的,而非各邊孤立預測。

標準資料集是 Visual Genome,而一個決定性的挑戰是長尾、偏斜的謂詞分布:像「在上」「有」這類瑣碎謂詞佔多數,於是模型可能在召回率上得高分卻忽略「騎」或「站在」等資訊量大的關係。這催生了無偏 SGG 與平均召回率指標(跨謂詞類別平均召回率,以獎勵罕見者)。場景圖之所以重要,是因為它為下游推理提供了明確的結構——它支撐組合式 VQA(GQA 即由場景圖建構而成)、有接地的影像生成與檢索,以及尊重關係而非只羅列物件的影像描述。

別只用單純的 Recall@K 來評斷 SGG:由於謂詞極度不平衡,一個到處預測「在上」「有」的模型可能看起來不錯,實際上卻沒說出任何有用之物。務必查看平均召回率(mR@K),它對各謂詞類別取平均,能揭露模型是否捕捉到罕見而語意豐富的關係。

又称
SGGvisual relationship detection