線性迴歸(linear regression)
/ LIN-ee-ur ree-GRESH-un /
線性迴歸是統計學習裡最古老、最簡單的主力工具:在一團散點中畫出那條穿得最貼切的直線。假設你把幾百套房子的面積與價格畫成散點圖。點是散開的,但明顯呈上升趨勢——房子越大,價格越高。線性迴歸會找出那條盡可能貼近所有點的直線,於是給定一套新房子的面積,你就能直接從線上讀出它大概的價格。
準確地說,它把要預測的數字(輸出)寫成各個輸入的加權和再加一個常數:價格 = w1 × 面積 + w2 × 臥室數 + … + b。這些權重說明每個特徵把答案往上或往下推多少;而那條直線(輸入有好幾個時則是一個平面)的選取標準,是讓它的預測值與真實答案之間的總平方誤差盡可能小——這就是「最小二乘」的含義。只有一個輸入時它是一條你能憑眼睛畫出的線;輸入很多時,則是同一個思路在更高維度裡的延伸。
它之所以重要,是因為它可解釋、速度快,而且常常是一個清醒的基線——更花俏的方法必須先打敗它,才配證明自己值得。「面積(平方英尺)」上的權重若是200,字面上就讀作「每多一平方英尺,價格約增加200美元」。但要誠實:它假設這種關係大致真的是一條直線。若真相彎成了曲線,直線就會擬合得很差;而少數幾個極端的離群點,也能把整條線拽歪。它刻畫的是關聯,並不能證明因果。
五個城鎮,畫成(冰淇淋銷量,平均氣溫)。點子向右上方一路攀升。擬合一條直線,得到 銷量 ≈ 50 × 氣溫 − 300。氣溫30°C時,這條線預測賣出1200支——一個直接從斜率上讀出的快速預報。
一個輸入、一個輸出:最佳擬合直線把氣溫變成一份銷量預報。
「線性」指的是權重的關係,而不是圖形——把特徵做平方或取對數後再加進來,仍算線性迴歸,所以它能彎曲的程度比名字暗示的要大。但它預測的是數字,不是類別;要回答「是/否」,請改用邏輯迴歸。