經典與統計學習

邏輯迴歸(logistic regression)

/ luh-JIS-tik ree-GRESH-un /

別被名字騙了,邏輯迴歸其實是個分類器——它回答「是/否」這類問題,而不是預測一個原始數字。這封郵件是垃圾郵件嗎?這位病人會復發嗎?這位顧客會點擊嗎?它不會硬給一個乾巴巴的「是」或「否」,而是返回一個介於0到1之間的概率,比如「這是垃圾郵件的可能性有83%」。這種留有餘地的答案,往往比一句生硬的判決有用得多,因為你可以自己選擇行動的閾值。

在內部,它的開頭與線性迴歸一模一樣——先做一個輸入的加權和——然後把這個和送過一條S形曲線,叫作邏輯函數(又稱S形函數),它能把任何數字,無論多大多小,溫柔地壓進0到1的區間。在一側遠端它飽和成近乎確定(0.99),另一側遠端則近乎不可能(0.01),而在模糊的中段變化最快。權重經過調整,使預測出的概率盡可能貼合訓練資料裡真實的「是/否」標籤。

它之所以站得住腳,是因為它速度快、穩健、且可解釋:每個權重都告訴你某個特徵把勝算往哪邊、推多用力。在醫學、信用評分和市場行銷裡,它都是標準的首次嘗試,也是更精巧的模型必須設法超越的基線。它的軟肋和它的表親一樣——它在兩類之間畫的是一條直線邊界,所以如果真正的分界線是彎的,除非你親手設計出更巧妙的特徵,否則它會很吃力。

一家診所根據一個數字——空腹血糖——預測糖尿病風險。邏輯迴歸學到一條S曲線:血糖90時它輸出5%的風險,126時越過50%,200時讀到95%。醫生把報警閾值設在比如30%——這個選擇獨立於模型本身。

和線性迴歸一樣的加權和,經過S曲線彎折成一個概率。

它叫「迴歸」,做的卻是分類——這是個長盛不衰的混淆點。還要記住,它給出的概率,誠實程度不會超過你的資料:用有偏的樣本訓練它,那些百分比無論看起來多自信,也一樣是偏的。

又稱
logit model逻辑回归邏輯迴歸对数几率回归