概率分布(probability distribution)
/ prob-uh-BIL-uh-tee dis-truh-BYOO-shun /
概率分布是对「每种可能结果有多大可能」的一份完整账目。如果说随机变量是「这件不确定的事会是哪个数?」这个问题,那么分布就是这道题的完整答案:它把每一个可能取值,连同它分到的那份概率,一一摆开。把它想成:一笔固定的「确定性预算」——正好是 1,也就是 100%——是怎样分摊到所有可能发生的事情上去的。
对于只有几种离散结果的东西,分布无非是一张清单:一颗公平的骰子把预算平均铺开,每一面 1/6。而对于身高这类连续量,你则要画一条平滑的曲线,曲线下任意一段的面积,就告诉你落在那个区间里的概率,而总面积恰好是 1。曲线的形状就是全部的故事——它鼓起来的地方,对应的取值常见;它瘦下去的地方,取值稀罕。著名的形状包括钟形的正态分布,以及非此即彼的伯努利分布。
机器学习骨子里就是「学习分布」这门活计。一个分类器输出的是一个关于标签的分布(「80% 是猫、15% 是狗、5% 是狐狸」)。一个语言模型产出的,是一个关于「下一个词是哪个」的分布。训练,就是把模型的分布推得去贴合真实数据里的规律。认清「输出是一个分布,而非单一的硬答案」,正是模型能够诚实地表达不确定的缘由——也让我们能借助交叉熵这类工具,去衡量它的信念离真相有多远。
抛两枚公平硬币,数一数正面的个数。各种结果是这样分摊开的:0 个正面,概率 1/4;1 个正面,概率 1/2;2 个正面,概率 1/4。这三个数加起来恰好是 1,构成了这个分布——注意中间那个值的可能性是其余的两倍,因为「一个正面」有两种凑法(正反 和 反正)。
抛两次硬币:0、1、2 个正面对应概率 1/4、1/2、1/4——一笔加总为 1 的完整确定性预算。
对于连续分布,曲线的高度是「密度」,而非概率——只有它下方的面积才给出概率,这正是为什么取到任何单独一个精确值的机会实际上为零。任何合法分布的概率(或总面积)都必须恰好加总为 1。