假设检验、p 值与显著性
/ hy-POTH-eh-sis; PEE-value /
假设一条新的核保规则本应降低理赔。一年之后,理赔略有下降——但这是真实的效应,还是只是运气使然、那种即便规则毫无作用也会因偶然而出现的下滑?假设检验正是为这个问题设立的正式“法庭”。它先假定那个无趣的解释为真(规则毫无作用),然后追问:数据是否太过出人意料,以致无法与这一假定相容?
那个无趣的解释是原假设(零假设);有趣的那个是备择假设。我们计算一个检验统计量,衡量数据离原假设所预测的有多远,再算出 p 值:在原假设为真的前提下,看到至少这般极端的数据的概率。小的 p 值(通常低于 0.05)意味着数据在原假设下会令人意外,于是我们“拒绝原假设”,并称结果具有统计显著性。例如,p 值为 0.01 表示:在原假设下,纯粹由偶然产生如此惊人结果的情形只占 1%。至关重要的是,大的 p 值并不能证明原假设——它只是未能提供反对它的证据。
精算师用这些检验来追问:某个费率变量是否真的影响损失、观察到的死亡率是否不同于标准表、某个模型项是否配得上它的位置。但这套框架被广泛滥用,因此诚实地使用它需要谨慎。0.05 这个分界线是任意的约定,而非自然法则。统计显著性不等于实际重要性——数据足够多时,一个微不足道、毫无用处的差异也会变得“显著”。而 p 值既不是原假设为真的概率,也不是你的发现纯属偶然的概率;它是在假定原假设下关于数据的一项陈述。做很多次检验却只报告显著的那些(p 值操纵)会制造出虚假的发现。
精算师检验某地区的死亡率是否超出标准表。检验给出 0.002 的 p 值,远低于 0.05,故这一超额具有统计显著性——该地区看来确实死亡率偏高,而不只是运气不好的一年。
小的 p 值,标示出一个极端到难以心安理得归咎于偶然的结果。
统计显著性不等于实际重要性,p 值也不是原假设为真的概率。数据量极大时,一个毫无意义的差异也可能“高度显著”。