學習範式

主動學習(active learning)

/ AK-tiv LER-ning /

聰明的學生不會讓老師把自己早已懂的東西再講一遍;他們恰恰在自己犯迷糊的那些點上舉手。這種有的放矢的提問,正是主動學習的核心:模型不再隨機地給資料貼標籤,而是由它自己挑出哪些無標籤的例子最能教會它,再請人專門去標註那些。

動機在於成本。標註是機器學習裡最燒錢的環節——花錢請專家標記影像、轉寫音訊、評判文字。一個大的無標籤池裡,多數例子又簡單又重複,標了它們模型也學不到什麼。主動學習是個循環:先用手頭的資料訓練,再掃一遍無標籤池,挑出模型最拿不準的(或最可能改變它判斷的)那些例子,送去給人標,把新標籤併進來,然後重複。把標註預算花在刀刃上,你就能用少得多的標註例子達到同樣的準確度。

只要無標籤資料充裕、而標註又慢又貴,它就確實有用。誠實的提醒:一味追著模型最拿不準的點跑,可能把標註集偏向古怪的邊角案例,反而漏掉了尋常的大頭;而模型對「拿不準」的判斷,又不會比模型本身更高明——在早期,它對「自己不知道什麼」可能正自信地錯著。它還需要一個人始終在環裡,這限制了它能擴展到多大規模。

一個團隊要給10萬張產品照片打標籤,預算卻只夠標5000張。他們先用一小批種子資料訓練,再讓模型挑出它最沒把握的那5000張——刁鑽的角度、模糊的鏡頭、含混的類別。標註這些有針對性的案例,得到的模型遠勝於隨機抽5000張來標。

把標註預算花在最能教會模型的那些例子上。

模型對「什麼是不確定的」的感覺,可靠程度不會超過模型本身——早期它可能正自信地錯著,而過度追逐邊角案例會讓標註集偏離常見情形。

又稱
query learning主动学习主動學習