零調整分布
許多真實的理賠件數數據有個奇怪的特點:零理賠的保單數量與標準泊松或負二項的預測對不上。往往零遠多於預期(大多數人根本從不理賠),偶爾又更少甚至沒有(在至少必有一件的情形下)。零調整分布是一種乾淨的辦法:保留一個熟悉的計數模型,同時把零的概率重設到與現實相符。
它從一個母分布(泊松、二項或負二項)出發,把P(N=0)替換為一個選定的值,再把所有正件數的概率按比例重新標定,使整體之和仍為1。如果選定的零概率高於母分布的,你得到一個零膨脹模型(多出來的零);如果把它恰好設為零,你得到一個特例,稱為零截斷(用於沒有事件不可能被觀察到的情形,例如只針對理賠者的數據)。件數1、2、3……之間的相對形狀繼承自母分布;改變的只是零上的權重以及整體的縮放。這使零調整分布成為(a,b,1)類的一員。
凡是零的數量大而重要的地方,零調整就很要緊——牙科保險、延長保修,以及許多絕大多數人從不理賠的低頻險種,把P(N=0)弄對就主導了整個擬合。從實用角度看,它讓你保留方便的泊松或負二項機器(包括潘哲遞迴),同時誠實地擬合那一大堆零。誠實的提醒是:調整零是一個有針對性的修補,而非萬靈藥。如果數據在尾部和在零處都不對,那麼對一個設定錯誤的母分布做零調整,只是在一個未被糾正的錯誤之上再疊一層修正;你仍應檢查整體擬合,而不只是看零這一格。
一份牙科業務的母泊松(lambda=0.5)預測P(N=0)=e^(-0.5)=0.607,但數據顯示75%的成員分文不報。一個零調整泊松把P(N=0)設為0.75,並把1、2、3……件理賠的概率按泊松原有的相對比例縮小、去分攤剩下的25%——與觀測到的那一大堆零匹配得好得多。
把零的概率重設到與數據相符;正件數仍沿用母分布的形狀。
零調整只糾正零這一格。如果母模型在尾部也錯了,修正零只會掩蓋這一點;務必在所有件數上驗證擬合,而不只看「無理賠」的概率。