抽样与抽样分布
/ SAM-pling /
想象你把手伸进一个装满编号小球的大缸,抓出一把,写下它们的平均值。然后放回去,再抓一把,得到稍微不同的平均值。这样做上千次,这些平均值本身就会形成一种规律——大多数聚在缸内真实平均值附近,少数落得很远。这种“当你不断重新抽样时样本平均值的表现”的规律,就是抽样分布。它是衡量单个样本有多可信的最重要的一个观念。
抽样是从总体中抽取观测值的动作;随机抽样意味着每个个体被抽中的概率是已知的,因此样本是公平的,而不是被刻意挑选的。现在是关键的转折:任何由样本算出的统计量——样本均值、样本方差、拟合出的斜率——本身都是一个随机量,因为换一个样本就会给出新的值。它的概率分布就是抽样分布。对于来自均值为 m、标准差为 s 的总体的 n 个观测值的样本均值,其抽样分布中心仍是 m,但散布要小得多,为 s / sqrt(n)。所以对 100 个值求平均,得到的估计比单个值的抖动小十倍,因为 sqrt(100) = 10。
精算师很少在心里不悄悄追问“如果换一批数据,这个数字会跳动多少?”的情况下看待任何一个数字。这正是抽样分布在起作用。它是从点估计通向标准误差与置信区间的桥梁。中心极限定理是让这一切变得实用的礼物:当 n 很大时,几乎不论总体本身是什么形状,均值的抽样分布都近似正态——这正是众多精算置信陈述默默假定正态性的原因。
理赔金额极度偏斜,然而随机抽取的 1,000 笔理赔的平均值,其表现却几乎像一条整齐的钟形曲线。这正是为什么即便单笔理赔毫无钟形可言,精算师仍能给平均值加上一个干净的正负区间。
样本均值的散布以 1 / sqrt(n) 的速度缩小:数据量翻四倍,抖动减半。
抽样分布描述的是统计量,而不是原始数据。把单个观测值的散布(s)与其平均值的散布(s / sqrt(n))混为一谈,是最常见的统计错误之一。