化学分析中的统计学
置信区间
/ KON-fi-dens IN-ter-val /
当天气软件说明天最高气温「大约 20 度」,你会本能地把它读成一个区间,而不是承诺:大概在十几到二十出头之间。置信区间就是把这种留有余地说得精确。它不假装你测得的平均值就是确切的真相,而是给出一个真值极可能落在其中的范围。
置信区间是围绕你的样本平均值建立的一个范围,宽到足以保证:长远来看,这类区间中有规定的比例——通常是 95%——会罩住真值。它的宽窄取决于你的测量有多散、做了多少次:方法越吵闹、重复越少,区间就越宽、越谦虚;数据越紧、重复越多,区间就越窄。
它之所以重要,是因为它把一个孤零零的数变成一句诚实的「我有多大把握」,而这正是监管机构、期刊和客户真正需要的。最常见的误读是说「真值有 95% 的概率落在这个特定区间里」;更严谨地讲,是这套做法有 95% 的时候会成功,而任何一个具体区间,要么含着真值,要么不含。
对水中铅的四次测量平均为 11.2 微克每升。算出的 95% 置信区间是 11.2 加减 0.6,于是结果报告为 10.6 到 11.8 微克每升。
把平均值连同真值最可能所处的范围一起报告。
对同一组数据,99% 区间比 95% 区间更宽:要求更高的把握,就得撒下更大的网。当测量次数很少时,区间用 t 分布而非高斯分布来构建。
又称
另见