数学基础

随机变量(random variable)

/ RAN-dum VAIR-ee-uh-bul /

随机变量是一个取值尚未敲定的数,因为它取决于偶然。在你掷骰子之前,「掷出的点数」就是一个随机变量——你知道它会落在1到6之间,却不知道究竟是哪一个。骰子一停,这个随机变量便取定了一个确切的值。所以它与其说是单独一个数,不如说是「这个不确定的过程将吐出哪个数」的一个占位符。

给不确定性起个名字,意义在于你随后就能拿它做数学了:问它平均下来倾向于取什么值、它上下蹦跶得有多厉害、每种结果又有多大可能。随机变量分两类。离散型取的是一个个分立、可数的值,比如掷骰子的点数,或你明天会收到几封邮件。连续型则可以取某个范围内的任意值,比如一个人确切的身高,或正午的气温。

机器学习里到处都是随机变量,因为它要学习的那个世界本就充满不确定。一张还没见过的图片的标签、语言模型接下来会生成的那个词、传感器读数里的噪声——统统被建模成随机变量。这样去处理各种量,能让模型不只给出一个猜测,还给出一份信心程度,也让我们能干净利落地推理误差、风险与意外。一句有用的提醒:把某样东西叫作随机变量,并不意味着它在某种宇宙意义上真的「随机」——只是说,鉴于我们已知的东西,我们选择把它当作不确定来建模罢了。

设 X 是掷一次骰子的结果。X 是一个离散随机变量,可以等于 1、2、3、4、5 或 6,每个的概率都是 1/6。再设 Y 是你所在城市明天的最高气温——一个连续随机变量,它可能是 18.3°C、18.34°C,或附近任何一个值。给 X 和 Y 起了名字,我们才能去算它们的平均与离散程度。

X(掷骰)是离散的;Y(气温)是连续的——两者都是「一个尚未敲定的数」的占位符。

随机变量不是一个贴了标签的固定数——它是「所有可能取值,连同它们各自的概率」打成的一整捆。这串概率列出来,就是它的概率分布,也就是下一个该学的概念。

又称
随机变量隨機變量隨機變數随机变数