重叠群与支架(contigs and scaffolds)
当你重组那本被碎掉的书时,你很少能一气呵成地把整本拼回来。更常见的是,你拼出几段又长又确信的文字——你确定是连续读下去的段落——它们之间夹着一些地方,那里要么碎片用尽,要么混乱得无法放置。即使这些模糊的空缺还没填上,知道那几段确信文字的先后顺序、以及它们之间空缺大致有多大,仍然极其有用。基因组组装恰好产出这两个层次,分别叫做重叠群(contig)和支架(scaffold)。
重叠群是组装程序无缺口地重建出的一段连续序列——重叠的读段被合并成一串不间断的字母。但重复序列和缺失的数据会在重叠群之间留下断点。支架是更高一层:它给一组重叠群排好顺序和方向,并记录它们之间空缺的大致长度,即便那些空缺里的确切字母仍属未知。这些空缺通常写成一连串字母 N,作为占位符,意思是“我们大致知道这里有这么多个碱基,但不知道是哪些”。把它们连起来的信息来自一些线索,比如成对读段——它们的两端落在不同的重叠群里,且两端之间的距离是已知的。
这个两层的图景就是大多数已发表基因组诚实的实情。“染色体级”组装意味着支架长到足以横跨整条染色体;而“草图”基因组可能是几千个重叠群、分布在许多短支架里。重叠群和支架的数目与大小——常用一个叫 N50 的统计量来概括——正是生物学家判断一份组装质量的依据。理解这个区别很重要,因为一个挨着空缺、或被劈成两个重叠群的基因,可能被数错或干脆被漏掉,所以组装质量直接决定了你能信任哪些结论。
一份组装可能报告说有 200 个重叠群被连成 12 个支架;在一个支架里你可能看到 ...ACGTTGA NNNNNNNNNN GCATTACG...,其中那串 N 标记着一个大约 10 个碱基的空缺,它的位置已知,但具体字母未知。
重叠群是无缺口的连续段;支架则在以 N 标记的空缺之间给重叠群排序。
基因组文件里一长串 N 并不是真实序列——它是一个估计长度的空缺。把 N 串当成数据是初学者的典型错误。