金曼聚合過程(Kingman's coalescent)
/ KING-man /
分支過程把族群向前推進。但遺傳學家問的是相反的問題:給定今日存活的族群,其譜系向後看是什麼樣子——今日個體何時共享共同祖先?金曼聚合過程是典型的答案:一個向後時間運行的馬可夫過程,從 n 條分離的譜系開始,逐步成對合併,直到全部聚合為單一的最近共同祖先。它是大型、中性演化族群的普適譜系,並藉由把資料(今日的樣本)置於模型核心,革新了族群遺傳學。
n-聚合過程是 {1, ..., n} 之集合分割上的連續時間馬可夫鏈,從分割為單點集開始。每對相異區塊(譜系)獨立地以速率 1 合併;故當有 k 個區塊時,總合併速率為 C(k, 2) = k(k-1)/2,且一個均勻選取的對聚合。當有 k 條譜系時的等待時間 T_k 因此是 Exponential(C(k,2)),平均 2/(k(k-1))。兩個乾淨的推論:回溯到最近共同祖先的總時間為 T_MRCA = sum_(k=2)^n T_k,E[T_MRCA] = 2(1 - 1/n),即使對龐大樣本也以 2 為界——最深的分裂在譜系時間中發生得很快,但大部分等待花在最後幾次合併上(單是 E[T_2] = 1,即僅剩兩條譜系時的時間)。總枝長 L_n = sum_(k=2)^n k T_k 有 E[L_n] = 2 sum_(j=1)^(n-1) 1/j 約 2 log n,它(乘以突變率)預測樣本中的分離位點數。關鍵地,每次只有「成對」合併:同時的多重合併機率為零,這是金曼(相對於 Lambda 或 Xi)聚合過程的定義特徵。
重要性:金曼聚合過程是現代統計族群遺傳學的骨幹——人們在它之下詮釋 DNA 序列變異、估計有效族群大小、推定最近共同祖先的年代(包括「粒線體夏娃」)、並把選擇與族群成長偵測為對其預測的偏離。它作為一大類前向模型——Wright-Fisher、Moran、以及許多 Cannings 可交換模型——的普適譜系極限(在以族群大小做適當時間重尺度化之後)而出現,前提是子代變異數有限,且沒有單一個體佔有不可忽略比例的子代。最後這個前提是誠實的假設:當繁殖高度偏斜(少數個體可有極多子代,如某些海洋物種或強選擇掃蕩)時,成對合併的假設失效,正確的極限是具多重與同時合併的 Lambda- 或 Xi-聚合過程。
取樣 n = 100 個個體。回溯到其單一共同祖先的期望時間為 E[T_MRCA] = 2(1 - 1/100) = 1.98 個聚合時間單位,僅比 10 個樣本(1.8)略多。但平均而言,這段時間有一半以上是僅剩兩條譜系時的最後一段(E[T_2] = 1)——譜系深度的大部分都在它最後一次合併之中。
譜系以速率 C(k,2) 成對合併;即使對龐大樣本,回溯到共同祖先的時間也以 2 為界。
金曼聚合過程只允許成對合併(同時的多重合併機率為零),且僅當子代變異數有限、無個體主宰繁殖時才出現。高度偏斜的繁殖會使其失效,須改用 Lambda/Xi 聚合過程。