視覺神經網路基礎

logits(未正規化輸出 / 對數機率)

Logits 是網路的原始輸出分數,在被轉成機率之前的樣子。它們是無界的實數(可正、可零、可為很大的正值),logit 愈大代表「支持此類別的證據」愈多。softmax 或 sigmoid 是稍後把 logits 壓成乾淨機率分布的東西,但 logits 本身是最終線性層產生的未正規化分數。可把它們想成模型對證據的計分,尚未換算成百分比。

在分類器中,最終的全連接層輸出一個 logit 向量 z 屬於 R^K,每個類別一個分數;softmax 再把 z 映成機率 p = softmax(z)。這個名字來自 logit(對數勝算, log-odds)函數,即 sigmoid 的反函數:對兩類別而言,單一 logit 等於 log(p/(1-p))。由於 softmax 具平移不變性(對每個 logit 加同一常數不改變機率),只有 logits 之間的差有意義;絕對水準是個可任意選的標度。

差決定了預測的類別,但 logits 的整體尺度決定信心:把所有 logits 乘上一個大因子,softmax 就銳化趨向 one-hot(過度自信);縮小它們則壓平趨向均勻。這正是溫度旋鈕,也是現代網路常校準不佳的原因,其 logit 尺度產生的機率比真實準確率所應有的更極端。溫度縮放是最簡單的校準法,它只是在訓練後把 logits 除以一個學到的純量 T,使機率變得誠實。

永遠把 logits 留著:需要數值穩定的損失函數與指標是在 logits 上、而非機率上運算的。框架的交叉熵與二元交叉熵直接接受 logits,並在內部以穩定數學套用 log-softmax 或 sigmoid,所以你不該事先套 softmax。Logits 也餵入知識蒸餾(學生去匹配教師的溫度縮放 logits)與基於能量的分布外(out-of-distribution)偵測(logits 的 logsumexp 是一個能量分數,用來標示與訓練資料不同的輸入)。

陷阱:未校準網路給出的「機率 0.99」並不代表有 99% 的機會是對的;logit 尺度會誇大信心。若你需要可信賴的機率(醫學影像、自動駕駛),請做校準(溫度縮放),並以可靠度圖(reliability diagram)或期望校準誤差(ECE)驗證。

又称
scoresunnormalized log-probabilities對數機率