隨機變數的函數與變換

機率積分變換(probability integral transform)

這裡有個小奇蹟,把每一個連續分布都繫回同一個共同參照。取任何連續隨機變數 X,把它自己的值餵進它自己的累積分布函數 F,結果 U = F(X) 在 (0, 1) 上均勻分布 —— 不論 X 原本是什麼。厚尾、偏斜、鐘形:讓它通過自己的 cdf,出來的就是一個平坦、毫無特徵的均勻分布。

為什麼會這樣?cdf F 把 X 的每個值映到落在它左邊的機率比例。X 結果中最低的 10% 被映到 0.10 以下、最低的一半映到 0.50 以下,依此類推 —— 這正是輸出為均勻的意思:等大小的機率厚片映到等長度的區間。要驗證它,算 P(U at most u) = P(F(X) at most u) = P(X at most F^{-1}(u)) = F(F^{-1}(u)) = u,正是均勻分布的 cdf。cdf 正是依累積機率替結果排名的函數,所以它總會把自己的變數壓平。

這是兩件重要實務背後安靜的引擎。反過來用,它讓你能從一個均勻亂數生成任何分布(逆變換法)。正著用,它是配適度檢定與 copula 的基礎:把你的資料通過配適好的 cdf 變換,若配適得好,變換後的值應看起來像均勻。注意:只有當 X 連續時結果才「恰好」均勻;對有跳躍的離散 X,F(X) 落在離散集合上,並非均勻。

設 X 為率 1 的指數分布,故 F(x) = 1 - e^(-x)。則 U = F(X) = 1 - e^(-X) 在 (0, 1) 上均勻分布。驗證:P(U at most u) = P(1 - e^(-X) at most u) = P(X at most -ln(1 - u)) = 1 - e^(ln(1-u)) = u。偏斜的指數分布被它自己的 cdf 壓平成了均勻分布。

任何連續變數通過它自己的 cdf,出來都是 (0, 1) 上的均勻分布。

它只對連續 X 恰好成立。對離散 X,F(X) 並非均勻,因為 cdf 會跳躍並略過某些值。結果 U 是均勻的;別把它與 X 是均勻的混為一談。

又称
PITuniversality of the uniform機率積分轉換PIT