多模態大型語言模型
視覺編碼器(vision encoder)
視覺編碼器(vision encoder)是多模態模型的眼睛——真正盯著像素看的那一塊。在任何語言發生之前,這個網路掃過影像,把它濃縮成一組精簡的特徵向量,捕捉「這裡有張臉、那裡有條路、角落有字」。它通常是在龐大影像集上預訓練的視覺 Transformer,被凍結或輕微微調,並在許多語言模型間重複使用。
像 CLIP 影像編碼器這類模型,訓練目標是讓一張圖和它的標題在共享空間裡落得很近。這種預訓練讓特徵天生就為語言塑形,這正是把它接上大型語言模型如此好用的原因。編碼器每塊輸出一個向量,有時再加一個摘要向量,這些經由投影器進入模型。換上更大或更高解析度的編碼器,是改善視力的主要槓桿之一。
編碼器設下了天花板。如果它從沒學會讀密集文字或精細的醫學細節,再巧妙的提示也救不回它丟掉的東西——語言模型只能對眼睛遞過來的東西推理。
又称
另见