学习范式
主动学习(active learning)
/ AK-tiv LER-ning /
聪明的学生不会让老师把自己早已懂的东西再讲一遍;他们恰恰在自己犯迷糊的那些点上举手。这种有的放矢的提问,正是主动学习的核心:模型不再随机地给数据贴标签,而是由它自己挑出哪些无标签的例子最能教会它,再请人专门去标注那些。
动机在于成本。标注是机器学习里最烧钱的环节——花钱请专家标记影像、转写音频、评判文本。一个大的无标签池里,多数例子又简单又重复,标了它们模型也学不到什么。主动学习是个循环:先用手头的数据训练,再扫一遍无标签池,挑出模型最拿不准的(或最可能改变它判断的)那些例子,送去给人标,把新标签并进来,然后重复。把标注预算花在刀刃上,你就能用少得多的标注例子达到同样的准确度。
只要无标签数据充裕、而标注又慢又贵,它就确实有用。诚实的提醒:一味追着模型最拿不准的点跑,可能把标注集偏向古怪的边角案例,反而漏掉了寻常的大头;而模型对「拿不准」的判断,又不会比模型本身更高明——在早期,它对「自己不知道什么」可能正自信地错着。它还需要一个人始终在环里,这限制了它能扩展到多大规模。
一个团队要给10万张产品照片打标签,预算却只够标5000张。他们先用一小批种子数据训练,再让模型挑出它最没把握的那5000张——刁钻的角度、模糊的镜头、含混的类别。标注这些有针对性的案例,得到的模型远胜于随机抽5000张来标。
把标注预算花在最能教会模型的那些例子上。
模型对「什么是不确定的」的感觉,可靠程度不会超过模型本身——早期它可能正自信地错着,而过度追逐边角案例会让标注集偏离常见情形。
又称
另见