隨機變量(random variable)
/ RAN-dum VAIR-ee-uh-bul /
隨機變量是一個取值尚未敲定的數,因為它取決於偶然。在你擲骰子之前,「擲出的點數」就是一個隨機變量——你知道它會落在1到6之間,卻不知道究竟是哪一個。骰子一停,這個隨機變量便取定了一個確切的值。所以它與其說是單獨一個數,不如說是「這個不確定的過程將吐出哪個數」的一個佔位符。
給不確定性起個名字,意義在於你隨後就能拿它做數學了:問它平均下來傾向於取什麼值、它上下蹦跳得有多厲害、每種結果又有多大可能。隨機變量分兩類。離散型取的是一個個分立、可數的值,比如擲骰子的點數,或你明天會收到幾封郵件。連續型則可以取某個範圍內的任意值,比如一個人確切的身高,或正午的氣溫。
機器學習裡到處都是隨機變量,因為它要學習的那個世界本就充滿不確定。一張還沒見過的圖片的標籤、語言模型接下來會生成的那個詞、感測器讀數裡的雜訊——統統被建模成隨機變量。這樣去處理各種量,能讓模型不只給出一個猜測,還給出一份信心程度,也讓我們能乾淨俐落地推理誤差、風險與意外。一句有用的提醒:把某樣東西叫作隨機變量,並不意味著它在某種宇宙意義上真的「隨機」——只是說,鑑於我們已知的東西,我們選擇把它當作不確定來建模罷了。
設 X 是擲一次骰子的結果。X 是一個離散隨機變量,可以等於 1、2、3、4、5 或 6,每個的機率都是 1/6。再設 Y 是你所在城市明天的最高氣溫——一個連續隨機變量,它可能是 18.3°C、18.34°C,或附近任何一個值。給 X 和 Y 起了名字,我們才能去算它們的平均與離散程度。
X(擲骰)是離散的;Y(氣溫)是連續的——兩者都是「一個尚未敲定的數」的佔位符。
隨機變量不是一個貼了標籤的固定數——它是「所有可能取值,連同它們各自的機率」打成的一整捆。這串機率列出來,就是它的機率分布,也就是下一個該學的概念。