隨機變數與其分布
離散與連續隨機變數(discrete vs continuous random variables)
隨機變數主要有兩種型態,處理它們的工具完全不同。離散隨機變數只能取那些原則上可以一個一個列舉出來的值:0, 1, 2, 3, ...,例如你今天收到的電子郵件數量,或十次擲硬幣中正面的次數。連續隨機變數可以取某個範圍內任何沒有空隙的值,像是一個人的確切身高、公車到站前的時間,或在數線上選取的一個點。在 1.732 公尺之後沒有「下一個」值。
這個區分之所以重要,在於機率分布的方式。對離散變數而言,機率以一塊一塊的形式落在個別的值上:每個值都可以帶有正的機率,而這些機率加總為 1。你用機率質量函數(pmf)來描述它,它對每個可能的 x 給出 P(X = x)。對連續變數而言,任何單一的確切值都不帶任何機率(恰好是 1.732000... 公尺的機率為零);機率沿著區間平滑地散布,你用機率密度函數(pdf)來描述它,其中機率是曲線下、靠積分求得的面積。
一個好用的判斷法:你能不能(哪怕只是原則上)把可能的值列舉出來?如果可以(可能是像 0, 1, 2, ... 的無窮列表),它就是離散的;如果這些值填滿一個區間,它就是連續的。誠實的提醒:這兩種並非故事的全部。有些變數是混合的,有平滑的部分再加上一兩個塊(例如降雨量恰好為 0 的機率為正,但其餘部分連續散布)。乾淨的「離散或連續」圖像是個起點,而不是自然律。
一小時內店裡的顧客數:離散(0, 1, 2, ...)。每位顧客排隊等候的時間:連續(任何非負實數)。同一家店同時產生這兩種變數。
計數通常是離散的;在連續刻度上的測量通常是連續的。
真實的測量以有限精度記錄,所以看起來是離散的。我們之所以把它們建模為連續,是因為平滑的 pdf 處理起來容易得多、而且是極佳的近似,並非因為現實具有無限的解析度。
另见