擴增、定序與核酸分析

覆蓋度/定序深度(coverage / depth)

想像給一頁文稿校對,辦法是讓許多人各讀幾行彼此重疊的內容。如果這一頁上的每個位置都被比如說三十個不同的人讀過,那麼即使某一個讀者看走了眼,你仍可信賴大多數人的共識。定序覆蓋度(或深度)對DNA而言正是這個思路:基因組中每個位置被多少條獨立的讀長覆蓋。

由於單條定序讀長既短又有一定錯誤率,一次定序實驗會有意地從許多不同片段把同一區域反覆讀多遍。某個位置的覆蓋度就是與它重疊的讀長數目;整體深度記作如30x,意思是平均每個鹼基被讀了約三十遍。深度越高,對每個鹼基的獨立觀察就越多,於是與參照之間真正的差異清晰凸顯,而隨機讀取錯誤會被多數票壓下去。覆蓋度在基因組上通常並不均勻——某些區域,尤其是重複區或GC含量極端的區域,得到的讀長較少,因而讀得不那麼可靠。

深度是定序中最重要的品質旋鈕之一,並直接決定你能下什麼結論。要有把握地判定一個雜合變異(你的兩份基因拷貝中有一份不同),需要足夠深度才能同時看到兩種版本;要檢出只存在於百分之幾細胞中的稀有突變(如腫瘤),則需要非常高的深度。但「更多」並非免費:深度耗費定序通量和金錢,所以實驗會被設計成達到與問題相稱的目標深度。一個僅靠低深度下一兩條讀長支持就聲稱檢出突變的說法,理應被健康地懷疑。

在某個基因組位置有30條讀長覆蓋它:15條讀作A,15條讀作G——這是一個清晰的雜合變異。如果只有2條讀長覆蓋該處、一條讀A、一條讀G,你就無法分辨這是真正的變異還是一次讀取錯誤。

每個位點讀得越多(深度越高),就越能把隨機錯誤壓下去。

覆蓋度並不均勻,而且「更多並非免費」——重複區或GC含量極端的區域讀得更少,僅憑低深度下一兩條讀長判定的變異並不可靠,所以標稱深度(如30x)只是平均值,可能掩蓋覆蓋很差的位點。

又稱
sequencing depthread depthfold coverage覆盖率測序深度