實驗設計與 A/B 測試
樣本比例失衡(SRM)
當使用者實際被分到各組的比例,和你原本設定的不一樣——你規劃了 50/50 的測試,最後卻變成 52/48。一個統計檢查會判斷這個落差是否大到「隨機運氣解釋不了」。
SRM 是一個響亮的警鈴,而不是拿來最佳化的指標:如果各組連你隨機指派的人數都湊不齊,就代表有東西壞了(重新導向把使用者弄丟、記錄程式有 bug、機器人過濾器對某一邊打擊較重),在你找到原因之前,整份結果都不該相信。在解讀任何 A/B 測試結果之前,永遠先跑一次 SRM 檢查。
一個本應 50/50、共 1,000,000 名使用者的測試,出現 510,000 對 490,000——卡方檢定算出極小的 p值,因此在找到 bug 之前這個實驗無效。
又稱