生成式AI與大型語言模型

文字生成圖像(text-to-image)

/ TEKST-too-IM-ij /

文字生成圖像,是把一段文字描述變成一張全新圖片的技術:你打「一隻小熊貓在溫馨的咖啡館裡讀報,水彩風格」,便出來一張與描述相符、卻從沒有人畫過的圖。它是Stable Diffusion、Midjourney、DALL·E這類工具的招牌絕活,是把兩塊拼到一起——一套理解語言的本領,和一套產出圖像的本領。

在引擎蓋之下,有兩樣東西在協作。首先,系統得把「詞」與「視覺概念」連起來,這通常靠一個在數億對「圖像—配文」(從網上爬來的)上訓練的模型,於是它學到「小熊貓」這幾個字,對應著某種毛茸茸的形狀與顏色。然後,一個圖像生成器——幾乎總是擴散模型——用這份理解去引導它的去噪,把隨機雪花拽向一張貼合提示的圖。文字在生成的每一步,都充當著一道導軌。

對它的局限與利害,要坦白說。這些系統在「觀感與氛圍」上出類拔萃,卻會在任何需要精確結構或邏輯之處栽跟頭:數數(「恰好五個蘋果」)、在圖裡把單詞拼對、正確的解剖、忠實的空間關係(「杯子在書的左邊」)。它們還引出了真實而懸而未決的問題——訓練用的圖像,往往包括了未經同意便爬取的受版權保護的照片和私人照片,而同樣的技術,也讓偽造真人的逼真假圖成為可能。圖很驚艷;可它的倫理與可靠性,是真真切切尚無定論的。

提示:「一名太空人在月球上騎馬,照片級寫實。」這樣的照片並不存在、也不可能存在,可系統卻產出了一張以假亂真的——因為它分別學過太空人、馬和月球長什麼樣,而那些去噪步驟把它們調和成了一幅連貫的場景。

把學來的概念組合成一幕從未存在過的場景。

文字生成圖像模型,恰恰在那些需要精確的地方很弱:數物體的個數、在圖裡把文字拼對、畫對手、處理好空間關係。它們還背著懸而未決的版權與同意問題,因為其訓練圖像,有很大一部分是未經許可爬取來的。

又稱
text-to-image generation文生图文本生成图像文字生成圖像