經典與統計學習
支持向量機(support vector machine)
/ suh-PORT VEK-tur muh-SHEEN /
支持向量機分開兩組的辦法,是畫出那條在它們之間留下盡可能寬的緩衝帶的邊界。想像紅藍兩色玻璃珠散在桌上,你得畫一條線把它們分開。許多條線都行,但SVM挑的是那條在兩側都留下最大空白間隔的——也就是讓每種顏色離它最近的珠子都盡量遠離它的那條。直覺在於:一條留有「呼吸空間」的邊界,更可能在它沒見過的珠子上也站得住。
真正起作用的只有少數幾個點——那些恰好坐在間隔邊緣、離對方組最近的點。它們就是「支持向量」,單憑它們就把邊界釘死在原處;你把其餘的點統統刪掉,這條線也不會挪動。這種對最難、最臨界的案例的專注,既是這個方法名字的由來,也是它穩健性的很大一部分來源。一個「軟間隔」的設定,允許少數幾個頑固的點落在錯誤的一側,用放棄完美切分來換取一條泛化更好的邊界。
單獨的SVM畫的是一條直線邊界,但配上核技巧,它就能彎曲、扭轉,去分開糾纏在一起的資料,這使它成為1990至2000年代最強的分類器之一。當你特徵很多、資料量卻只是中等時,它格外出色——文本分類曾是它的經典陣地。它的局限是:在極大的資料集上訓練可能很慢,它不會自然地給你概率,而選核及其設定也要費心。至於龐大的影像或語言任務,桂冠此後已被神經網路奪去。
用兩個特徵把郵件分成「垃圾」與「正常」。幾百個點,兩簇之間有些重疊。SVM不理會每一簇舒舒服服的中心,只盯著兩簇之間那幾封臨界的郵件——正是這些支持向量把分界線釘住,並留出它們所容許的最寬間隔。
只有臨界的那些點——支持向量——才釘住這條最寬間隔的邊界。
這條邊界只被支持向量釘住——也就是緊貼間隔的那些點——所以你的大部分資料對它沒有直接影響。沒有核技巧,SVM只能畫直線邊界;正是這對搭檔賦予了它擬合曲線的能力。
又稱
另見