精算概率论

离散分布与连续分布

有些量是一块一块、可以数清的;另一些量则可以在一条平滑的标尺上取任意值。今年的理赔次数是 0、1、2 或 3——绝不会是 2.7。但一笔理赔的金额可以是 2719.43 元,或介于其间的任何数额。前一种随机变量称为离散型,后一种称为连续型。你属于哪一类型,决定了如何描述它的概率。

离散型随机变量有一份(可能无限长的)彼此分开的可能取值清单,我们给每一个值都贴上一个真正的概率——即该值上的“概率质量”。连续型随机变量可以在一个范围内取任意值,这里会发生一件奇怪的事:任何单一确切取值的概率都是零,因为可能的值有无穷多个。我们改用一条密度曲线来描述连续变量,而概率就是该曲线在某区间上方所围的面积。所以对离散变量我们把概率相加,对连续变量我们做积分(求面积)。

精算师不断地与两者打交道,而且常常同时打交道。理赔频率(发生几次)天然是离散的——泊松、二项、负二项。理赔严重度(金额多大)天然是连续的——对数正态、伽玛、帕累托。总损失把一个离散的次数和连续的金额结合起来,这正是为什么总损失模型要把两者拼接在一起。选错类型——把计数当成连续,或把平滑的损失硬塞进几个区间——会悄无声息地扭曲结果。

明年的住院次数:离散(0、1、2、…)。每次住院的费用:连续(任意正金额)。一个健康模型对前者使用计数分布,对后者使用连续分布。

计数是离散的;金额通常是连续的——真实模型常常两者都需要。

对于连续变量,任何确切单一取值的概率都是零;只有区间才带有正概率,所以“P(损失恰好为 1000 元)”毫无意义,而“P(损失介于 900 元与 1100 元之间)”才有意义。

又称
discrete random variablecontinuous random variable离散型随机变量连续型随机变量