生成式AI與大型語言模型

擴散模型(diffusion model)

/ dih-FYOO-zhun MOD-ul /

擴散模型,是大多數現代圖像生成器背後的那種AI,而它的核心思想美得反直覺:它透過學習「去除噪聲」來學會「創造圖像」。訓練時,模型被餵以一批乾淨的圖像,這些圖像被逐步摻入隨機的雪花噪點——先一點點,再多些,直到幾乎是一片純粹的雪花——它則練習把每一步反過來,去預測「噪點稍少的那一版」長什麼樣。這樣練得夠多,模型便成了去噪的行家。

生成一張新圖像,便是把這門學來的本領從零反向跑一遍。你從一幀純粹的隨機噪聲起步——電視雪花——讓模型一步步給它去噪。每一步,它都把雪花往「一幅連貫的圖像」上挪近一點,並(在文生圖系統裡)由你的提示來引導。幾十步之後,噪聲便凝結成了一幅從未存在過的圖。這有點像一位雕塑家,在一塊粗糙的石料裡看見了一尊像,鑿去一切不屬於它的部分——只不過這裡的石料,是純粹的隨機。

值得把它與語言模型的不同、以及它做不到什麼,都直白說清。擴散模型並不是在檢索或拼貼已有的圖像;它是在從學來的模式裡取樣出一張全新的圖。這也意味著它對事實或邏輯毫無把握——它產出的是「統計上看著對」的東西,這正是為什麼生成圖裡會出現六根手指的手、亂碼般的文字,或物理上不可能的倒影。它是一個強大的、關於「事物外觀」的模式取樣器,而非一台「理解」的引擎。

從一塊純粹的電視雪花起步。第1步:模型輕輕一推,隱約的形狀浮現。第10步:一隻貓模糊的輪廓。第30步:一張清晰、細節豐富、卻從未存在過的貓的照片。每一步都去掉了一點噪聲,由模型所學到的「貓長什麼樣」來引導。

從隨機雪花到連貫圖像,一步一步地去噪。

擴散模型是在「生成」、而非「檢索」——那張貓照是從學來的模式裡取樣出來的,並非由訓練圖像縫補而成。這也是為什麼它對真理或解剖一無所知,會動輒產出多餘的手指、虛假的文字,或乍看沒問題、實則物理上不可能的畫面。

又稱
denoising diffusion model扩散模型擴散模型