評估與指標
A/B測試(A/B testing)
/ AY-bee TEST-ing /
離線指標能告訴你模型在過去的數據上得了多少分,卻沒法告訴你真實的人是否會真的反應更好。A/B測試透過跑一場真實的實驗來弄清這一點。你把用戶隨機分成兩組:A組保留當前版本(對照組),B組拿到新版本(變體組)。然後你觀察實際發生了什麼——點擊、購買、停留時長——並加以比較。
那味神奇的配料就是隨機。因為用戶是靠拋硬幣被分到A或B的,所以兩組在其他一切方面平均而言都相像——年齡、心情、設備、時段。於是,如果B組買得更多,那個新版本就是最說得通的原因,而不是兩組之間某種隱藏的差別。這和隨機臨床試驗是同一套邏輯,這也正是為什麼A/B測試是科技界最接近「真正的因果實驗」的東西。
做對了,它就是回答「這個改動到底有沒有幫助?」的黃金標準。但陷阱遍地都是,值得敬畏。提前偷看結果、一看好看就立刻收手,會抬高假陽性。樣本太小會誤導人。跑上幾十個測試,必然會有幾個純靠運氣顯得顯著。而且A/B測試衡量的,是「此刻在線的那些人」的短期行為——它可能漏掉長期效應、新鮮感的消退,或是對那些沒被納入實驗的用戶的傷害。一場乾淨的A/B測試,能精確地回答一個真實的問題;它並不能回答每一個問題。
某網站試用一種新的「立即購買」按鈕顏色。一半訪客(隨機)看到藍色,一半看到綠色。在10萬名訪客之後,綠色的轉化率為4.2%,藍色為4.0%,顯著性檢驗說這點差距不大可能是運氣。綠色勝出——但僅限於這個按鈕、這批受眾、這段時期。
隨機分組+顯著性檢驗=一個貨真價實、但適用範圍很窄的因果答案。
在開始之前就定好你的樣本量和停止點,並抵制「偷看」。反覆查看、一看結果好看就立刻收手,會極大地抬高假陽性——這是好心的A/B測試得出「自信卻錯誤」結論的最常見途徑之一。
又稱
另見