评估与指标
A/B测试(A/B testing)
/ AY-bee TEST-ing /
离线指标能告诉你模型在过去的数据上得了多少分,却没法告诉你真实的人是否会真的反应更好。A/B测试通过跑一场真实的实验来弄清这一点。你把用户随机分成两组:A组保留当前版本(对照组),B组拿到新版本(变体组)。然后你观察实际发生了什么——点击、购买、停留时长——并加以比较。
那味神奇的配料就是随机。因为用户是靠抛硬币被分到A或B的,所以两组在其他一切方面平均而言都相像——年龄、心情、设备、时段。于是,如果B组买得更多,那个新版本就是最说得通的原因,而不是两组之间某种隐藏的差别。这和随机临床试验是同一套逻辑,这也正是为什么A/B测试是科技界最接近「真正的因果实验」的东西。
做对了,它就是回答「这个改动到底有没有帮助?」的黄金标准。但陷阱遍地都是,值得敬畏。提前偷看结果、一看好看就立刻收手,会抬高假阳性。样本太小会误导人。跑上几十个测试,必然会有几个纯靠运气显得显著。而且A/B测试衡量的,是「此刻在线的那些人」的短期行为——它可能漏掉长期效应、新鲜感的消退,或是对那些没被纳入实验的用户的伤害。一场干净的A/B测试,能精确地回答一个真实的问题;它并不能回答每一个问题。
某网站试用一种新的「立即购买」按钮颜色。一半访客(随机)看到蓝色,一半看到绿色。在10万名访客之后,绿色的转化率为4.2%,蓝色为4.0%,显著性检验说这点差距不大可能是运气。绿色胜出——但仅限于这个按钮、这批受众、这段时期。
随机分组+显著性检验=一个货真价实、但适用范围很窄的因果答案。
在开始之前就定好你的样本量和停止点,并抵制「偷看」。反复查看、一看结果好看就立刻收手,会极大地抬高假阳性——这是好心的A/B测试得出「自信却错误」结论的最常见途径之一。
又称
另见