多模態大型語言模型
由大型語言模型生成影像(image generation from LLMs)
到目前為止,多數多模態模型只讀影像;這一條講的是畫影像。你打出一隻水彩風格的狐狸在雨中讀報,就得到一張圖。語言模型的角色是理解這個要求——包括又長、又細膩、又多段的描述——並引導一個獨立的影像生成器(通常是擴散模型)精準畫出那樣東西。
主要有兩種模式。耦合式裡,語言模型仍是文字模型,把一段豐富的提示、或學到的條件向量,交給擴散生成器去畫像素;語言模型的強項在於把含糊或對話式的要求轉成精確的指令,並跨回合編修。統一式裡,同一個 Transformer 直接預測影像詞元,再由解碼器算繪出來——讓一個模型在單一串流裡交錯文字與圖片,很適合圖文並茂的回答。
這些系統算繪的是看似合理而非真實:數量、影像中的文字、人體結構,以及忠實的局部編修(如只換帽子)都是經典的失敗點;它們還引出文字生成所沒有的著作權、深偽與當事人同意的現實難題。
又称
另见