機器學習
歸納偏好(inductive bias)
/ in-DUK-tiv BY-us /
歸納偏好,是一種學習方法所用的一組內建假設,用來在無數條同樣能擬合訓練資料的規則之間做出取捨。它要解決的問題是這樣的:任何一批有限的例子,都能被無窮多條不同的規則解釋。給你看數字 2、4、6,你也許會猜「每次加 2」——但「偶數」「位置乘以 2」,或某個稀奇古怪的公式,也都說得通。要從中挑出一條,學習者就必須倚靠一種「偏愛某類解釋勝過另一類」的傾向。這種傾向,就是它的歸納偏好。
若沒有這樣的偏好,從例子中學習根本無從談起——你永遠跨不出已經見過的那些資料。正是這種偏好,才讓模型得以泛化。不同的方法烤進了不同的假設:直線模型假設世界大致是線性的;用於影像的卷積網路假設一種模式無論出現在畫面哪個位置都是同一種;決策樹假設答案可以透過一連串是/否的分叉抵達。這些沒有一個是放之四海皆準的——它們都是關於「世界長什麼樣」的賭注。
更深的一點是:這裡的「偏好」不是缺陷,它是引擎。對某個問題握有恰當歸納偏好的學習者,能從很少的例子裡飛快學會;而偏好與問題不匹配的學習者,無論你扔給它多少資料,都學得又慢、又偏。這正是「沒有免費午餐」定理所精確言明的同一個洞見:不存在一種不帶假設、卻樣樣都最好的學習者。選擇一個模型,歸根結底,就是選擇要做哪些假設。
為什麼處理影像的網路要用卷積?因為設計者烤進了這樣一個假設:一隻貓無論待在照片的左上角還是右下角,都還是同一隻貓。正是這一條歸納偏好,讓模型用比「被迫在每個位置上分別重學一遍『貓』」的網路少得多的圖片,就能學會。
恰當的內建假設,能讓模型用更少的資料學到更多。
沒有歸納偏好,就沒有學習:一種零假設的方法,根本無法泛化到它的例子之外。功夫在於讓偏好與問題相匹配——在一項任務上的長處,到另一項上就成了短處。
又稱
另見