虛假相關(spurious correlation)
/ SPYUR-ee-us kor-uh-LAY-shun /
虛假相關,是一種在你的資料裡成立、卻並非結果背後那個真實因果緣由的模式——一樁被模型誤當成規律的巧合。冰淇淋銷量與溺水人數一同上升,可冰淇淋淹不死任何人;二者都由炎熱的夏日所致。一個只學資料、卻不理解世界的模型,會樂呵呵地攀附上這些偶然的關聯——因為對一個「找模式的人」來說,一個可靠的相關,與一個真正的原因同樣好用——直到那個相關斷掉的那一刻為止。
機器學習模型在「找出這些虛假相關」上厲害得驚人,常常比找出真實訊號還厲害,因為那些虛假的線索往往更容易被察覺。一個拍攝角度、一枚浮水印、一種背景紋理、醫療掃描儀的品牌、照片拍攝的時段——這其中任何一個,都可能在你的訓練集裡與標籤相關,卻根本不是你真正在意的那樣東西。模型學會了這條捷徑,在「分享同一樁巧合」的測試資料上考得漂漂亮亮,然後,一遇上那樁巧合不再成立的資料,就當場垮掉。
這之所以要緊,是因為虛假相關,是「實驗室裡管用、世界中失靈」一大批模型背後那個隱藏的禍首。它們在公平性上尤為陰險:一個模型可以攀附上一個與種族或性別相關的特徵,從而複製出歧視,卻從頭到尾都沒明著用過那個受保護的屬性。防範它們需要好奇心與功夫——多樣化的資料、用來看清「模型倚仗什麼」的可解釋性工具、以及在「刻意與訓練巧合脫鉤」的資料上做的測試。
一個被訓練用照片來偵測皮膚癌的模型表現極佳——直到有人注意到:在訓練影像裡,醫生為了測量惡性病灶,會在它旁邊放一把尺子。模型學到的是「有尺子=癌症」。在沒有尺子的真實照片上,它的本事便煙消雲散。這個相關,在訓練裡完美無瑕,在現實中卻毫無意義。
「尺子」問題:一個學會了醫生的習慣、而非皮膚病學的模型。
核心陷阱在於:高測試準確率,可能恰恰是在掩蓋一個虛假相關,而非證偽它——因為測試集通常與訓練集分享著同一樁巧合。唯一可靠的檢驗,是在「那條虛假線索被刻意去掉、或反轉過來」的資料上做測試——如果準確率應聲崩塌,那模型自始至終倚仗的,就是那條捷徑。