扩增、测序与核酸分析

覆盖度/测序深度(coverage / depth)

想象给一页文稿校对,办法是让许多人各读几行彼此重叠的内容。如果这一页上的每个位置都被比如说三十个不同的人读过,那么即使某一个读者看走了眼,你仍可信赖大多数人的共识。测序覆盖度(或深度)对DNA而言正是这个思路:基因组中每个位置被多少条独立的读长覆盖。

由于单条测序读长既短又有一定错误率,一次测序实验会有意地从许多不同片段把同一区域反复读多遍。某个位置的覆盖度就是与它重叠的读长数目;整体深度记作如30x,意思是平均每个碱基被读了约三十遍。深度越高,对每个碱基的独立观察就越多,于是与参照之间真正的差异清晰凸显,而随机读取错误会被多数票压下去。覆盖度在基因组上通常并不均匀——某些区域,尤其是重复区或GC含量极端的区域,得到的读长较少,因而读得不那么可靠。

深度是测序中最重要的质量旋钮之一,并直接决定你能下什么结论。要有把握地判定一个杂合变异(你的两份基因拷贝中有一份不同),需要足够深度才能同时看到两种版本;要检出只存在于百分之几细胞中的稀有突变(如肿瘤),则需要非常高的深度。但“更多”并非免费:深度耗费测序通量和金钱,所以实验会被设计成达到与问题相称的目标深度。一个仅靠低深度下一两条读长支持就声称检出突变的说法,理应被健康地怀疑。

在某个基因组位置有30条读长覆盖它:15条读作A,15条读作G——这是一个清晰的杂合变异。如果只有2条读长覆盖该处、一条读A、一条读G,你就无法分辨这是真正的变异还是一次读取错误。

每个位点读得越多(深度越高),就越能把随机错误压下去。

覆盖度并不均匀,而且“更多并非免费”——重复区或GC含量极端的区域读得更少,仅凭低深度下一两条读长判定的变异并不可靠,所以标称深度(如30x)只是平均值,可能掩盖覆盖很差的位点。

又称
sequencing depthread depthfold coverage覆盖率測序深度