學習範式

無監督學習(unsupervised learning)

/ un-soo-per-VIZED LER-ning /

想像你把一大盒混在一起的鈕扣倒在桌上,沒有人告訴你該分成哪些類別,你卻自己動手歸攏起來——這些是圓的、紅的,那些是方的、金屬的。沒有人給你標準答案;你只是看著看著,就找出了其中的結構。這就是無監督學習:電腦研究沒有標籤的資料,靠自己去發現裡面隱藏的模式、分組或形狀。

說得更準確些,無監督學習只用輸入,每個例子上並不附帶目標答案。兩件經典的活兒是聚類(把例子分進天然的群組,比如買東西口味相近的顧客)和降維(把許多測量值濃縮成寥寥幾個、卻抓得住要點,讓資料更易於觀察和儲存)。因為沒有答案卡,它的成敗只能間接判斷——分出來的組看著合不合理、對後續任務有沒有幫助——而不是靠一個簡單的分數。

它之所以重要,是因為帶標籤的資料既貴又少,而原始的、無標籤的資料卻到處都是。無監督方法讓你在還沒有人貼過任何標籤之前,就能探索一份新資料、發現異常、或先把資訊壓縮一番。但要誠實地說一句:沒有答案卡,結果就可能含糊不清。不同方法會把同一份資料切成不同的組,而往往並不存在唯一可證明為正確的答案——到頭來,還是得你這個人來判斷,它找到的結構是否真有意義。

一家網店並沒有「省錢黨」或「奢侈型買家」這樣的標籤。它把每位顧客的購買記錄餵進聚類演算法,演算法把他們分成幾個天然的群體。行銷團隊再去解讀這些群體並給它們起名——演算法找出了聚類,意義則由人賦予。

聚類找出群組,含義由人來定。

「無監督」並不等於「不費人力」——你仍要選方法、調參數,還要判斷找出的模式是否真實。而且這裡沒有唯一正確答案,兩次合理的執行也可能彼此不合。

又稱
无监督学习無監督學習unsupervised ML