生成模型理論
無分類器引導(CFG)
當你要擴散模型畫一隻柯基,你往往希望它畫出一隻一望即知的柯基,而不是一隻模糊的狗。無分類器引導就是用來加強每個樣本服從其條件之程度的旋鈕。它的做法是訓練一個網路同時扮演條件與無條件兩種角色,取樣時再從無條件預測朝條件預測的方向外推,放大條件所添加的一切。
具體而言,訓練時隨機丟棄條件,使同一個網路同時學到條件分數與無條件分數。取樣時,被引導的分數等於無條件分數加上一個引導權重乘以兩者之差。依貝氏定理,這個差正是「給定資料時條件的對數似然」之梯度,因此引導是隱含地由一個內含分類器在操舵,卻從不需訓練一個獨立的分類器,這正是名稱的由來。權重為一時回到尋常的條件取樣;較大的權重把樣本推向更高的條件似然。
引導是文字生成影像系統視覺衝擊力背後的核心槓桿,但它是一種取捨而非免費午餐:調高權重會提升提示忠實度與樣本銳利度,卻同時壓縮多樣性,而在高值下會使色彩過飽和、結構變形。
\tilde\epsilon_\theta(x,c)=\epsilon_\theta(x,\varnothing)+w\big(\epsilon_\theta(x,c)-\epsilon_\theta(x,\varnothing)\big)
從無條件預測朝條件預測外推;權重 w 控制忠實度與多樣性的取捨。
CFG 使取樣器偏向條件分布的高密度尾端,因此提升了感知品質與提示對齊,卻不再忠實取樣真正的條件分布。
又称
另见