評估、穩健性與倫理

Fréchet Inception 距離

FID 是評斷生成式影像模型——GAN、擴散模型之類——好壞的主導指標。難處在於「這張生成影像好不好?」沒有單一的標準答案,因此你無法像評分分類器那樣為它打分。FID 改為比較兩個影像集合——一大批真實影像與一大批生成影像——並問這兩個分佈有多相似。FID 越低越好:代表生成影像在統計上與真實影像難以區分,無論是品質(每張影像看起來都合理)還是多樣性(整個集合涵蓋了與真實同等的變化)。

它的作法是「根本不比較像素」。像素差異對生成而言毫無意義。FID 改為把每張影像送過一個預訓練的 Inception-v3 網路,從某一後段層讀出一個高維特徵向量(2048 維的 pool3 激活值)。這些特徵編碼的是語意內容——物件、紋理、結構——而非精確像素。接著你把「真實特徵」與「生成特徵」各自摘要成一個多維高斯分佈,為每個集合計算一個平均向量與一個共變異數矩陣。

分數是這兩個高斯之間的 Fréchet 距離(又稱 2-Wasserstein 距離),它有封閉形式:FID = ||μ_r − μ_g||² + Tr(Σ_r + Σ_g − 2(Σ_r Σ_g)^{1/2}),其中 μ_r、μ_g 是真實集與生成集的平均特徵向量,Σ_r、Σ_g 是它們的共變異數矩陣。第一項懲罰平均內容的偏移(品質);第二項懲罰散佈與相關性的不吻合(多樣性)。兩者都要吻合才能得到低分,這正是 FID 能捕捉模式崩潰(mode collapse)的原因——只生成少數幾種影像的模型,其共變異數太小、會被懲罰。

FID 的實務注意事項很重要。它會被樣本數偏誤:估計值會隨你使用更多生成影像而下降,因此公平起見必須在相同樣本數下比較模型(常用 50,000 張)。它繼承了 Inception 網路的 ImageNet 偏誤,因此在遠離自然照片的領域(人臉、醫學、藝術)最不可靠,而以 CLIP 特徵抽取器計算的 FID 等替代方案正逐漸受青睞。它假設特徵服從高斯分佈,這只是近似。而且 FID 把保真度與多樣性混成一個數字;為了把兩者拆開,研究者也會回報生成模型的精確率與召回率、KID(一種無偏的核變體),以及人工評估。儘管有這些侷限,FID 仍是標準,因為它與人類感知品質有合理相關,且計算成本低。

FID 是相對而非絕對的分數:「8」這個值,只有相對於「以完全相同的特徵網路、樣本數、影像前處理/縮放計算出的另一模型 FID」時才有意義。細微的縮放或函式庫差異可能讓 FID 偏移數分,因此跨論文比較時請重現完全相同的協定。

又稱
FIDFréchet distanceInception distance