應用:貝氏推論、資訊與模擬

變異數縮減(importance sampling、antithetic variates)

單純的蒙地卡羅有個頑固的弱點:它的誤差只以 1 比 sqrt(n) 的方式縮小,所以蠻力很貴。變異數縮減是這樣一門技藝:靠著聰明地選擇「如何」抽樣,而非只是抽更多,用遠少的樣本得到同樣的準確度。既然蒙地卡羅誤差是 sigma / sqrt(n),縮小有效的 sigma 跟增大 n 一樣值錢——而且往往便宜得多。

兩種主力技巧。重要性抽樣(importance sampling)拯救那些被罕見卻重要的事件所主導的估計:不從原始分布 p 抽樣,而是從一個巧妙選定的分布 q 抽,讓它更常造訪重要區域,再用每個樣本的概似比 p(x)/q(x) 加權來修正偏差。估計量 E_p[g(X)] 變成 g(X) 乘以 p(X)/q(X) 的 q-平均,它仍是不偏的,但當 q 把工夫集中在 g 乘以 p 很大的地方時,變異數可以戲劇性地降低。對立變量(antithetic variates)利用負相關:對每個樣本 U,你也用它的鏡像 1 - U(對稱變數則用 -X),這樣當一抽過頭時,它的夥伴傾向不及。把這對負相關的數平均,其變異數為 Var = (1/2)(Var(A) + Cov(A, B)),而那個負的共變異數免費地把它削到獨立情形以下。

除此之外,控制變量(control variates)減去一個你已知其均值的相關量,而擬蒙地卡羅(quasi-Monte Carlo)用巧妙鋪開的低差異序列取代隨機點,在性質良好的問題上可達到接近 1/n 而非 1 比 sqrt(n) 的誤差。誠實的提醒很重要:一個選得差的重要性分布 q 可能讓變異數「爆炸」(尤其當 q 的尾比 p 還輕,使得權重 p/q 飆升),而對立變量只在 g 夠單調、鏡像真的負相關時才有幫助。變異數縮減是槓桿,不是魔法——草率使用反而可能悄悄讓你的估計變差,而非變好。

要估計標準常態的 P(Z > 4)——一個約 0.00003 的微小機率——單純抽樣幾乎從不產生大於 4 的 Z,所以估計純粹是雜訊。重要性抽樣改從一個平移到以 4 附近為中心的常態抽,那裡罕見事件變得常見,再用概似比重新加權;如今多數樣本都有資訊量,幾千抽就能得到準確的估計。

縮小變異數跟增大 n 一樣值錢——但一個壞的方案會讓變異數爆炸。

重要性抽樣可能適得其反:若抽樣分布 q 的尾比目標還輕,權重 p/q 會飆升,變異數可能變成無窮——在有戲的地方抽樣,但別讓尾太輕。

又称
importance samplingantithetic variatescontrol variatesquasi-Monte Carlo變異數降低重要性抽樣對立變量