生成模型理論
離散擴散模型(discrete diffusion models)
標準擴散加的是高斯雜訊,這只對連續資料說得通。但文字、分子等符號資料活在離散空間裡,你無法對一個詞元加一點點高斯雜訊。離散擴散為這些空間重新定義破壞過程:它不去微調數值,而是隨機突變符號,例如依一個轉移矩陣把詞元翻成一個特殊的遮罩或隨機類別,直到整個序列被完全破壞,再學著把這些突變反轉回去。
前向過程是定義在類別狀態上的馬可夫鏈,其單步轉移是一個隨機矩陣;若採用一個吸收性的遮罩狀態,它就成為一個廣義的、任意次序的遮罩語言模型,而採用均勻轉移時則類似反覆的隨機替換。訓練最佳化的是一個離散狀態的證據下界,而連續時間表述則透過一個率矩陣來刻畫動力學,其反向依賴狀態之間邊際機率的比值,也就是分數的離散對應物。這個具體分數可用去雜訊目標來擬合,給出該領域的分數熵訓練原則。
離散擴散是生成序列時領先的非自迴歸替代方案,提供平行、任意次序的解碼與迭代精修,是語言與生物序列生成的一個活躍研究方向,不過它在大規模上尚未追平最強的自迴歸語言模型。
q(x_t\mid x_{t-1})=\mathrm{Cat}\big(x_t;\ p=Q_t\,x_{t-1}\big)
每個前向步驟把一個隨機轉移矩陣作用在獨熱詞元上;一個吸收性的遮罩欄就回到遮罩式的破壞。
吸收態(遮罩)離散擴散把遮罩語言模型推廣到任意遮罩比例與次序,這也是為何它讀來像是 BERT 式與擴散式生成之間一座有原則的橋。
又称
另见