基因组学、转录组学与系统生物学

基因组组装(genome assembly)

想象你拿来十本一模一样的厚书,把每一本都送进碎纸机,再把所有碎片混在一起。没有一片碎纸是编了号的,而且很多看起来都差不多。你的任务是只凭一个线索把整本书按顺序还原出来:凡是两片碎纸在撕裂的边缘上有一段相同的字句,它们很可能本来就紧挨在一起。把这个拼图放大到几十亿个 DNA 字母,就是基因组组装。

测序仪并不会把一条染色体从头读到尾。它读出的是海量的、彼此重叠的短片段,称为读段(reads)。基因组组装就是用计算把这些读段重新缝合成它们原本所在的那条长序列。软件去寻找重叠——一个读段的末尾与另一个读段的开头相吻合的地方——再把它们合并成更长的片段,就像你把边缘对得上的碎片拼在一起。由于每个区域都被读到很多次(即覆盖度),重叠足够密集,能找出真正的顺序;而对同一处反复读取,也让程序能把随机的测序错误投票剔除。

组装之所以困难,正是因为真实的基因组充满了重复序列:同一段长文字出现在许多地方,就像同一句话印在上百个不同的页面上。一个落在重复区里的短读段,可能来自其中任何一份拷贝,于是组装程序无法判断它该放在哪里,重建就此卡住或塌成一团乱麻。这就是为什么现代项目会把又短又准的读段和能横跨重复区的长读段混合使用,也是为什么没有哪份组装是真正完工的——大多数已发表的基因组都是带空缺的草图,而一个真正没有缺口、从端粒到端粒的完整人类基因组直到 2022 年才完成。

面对数百万条读段,组装程序发现以 ...GATTACA 结尾的读段 A 与以 GATTACA... 开头的读段 B 相重叠,便把它们连起来,如此重复数百万次,直到短读段长成一段段重建好的长染色体序列。

组装把重叠的读段合并成越来越长的序列,但在重复区上会遇到障碍。

一个“已测序”的基因组很少是一条完美无缺的字符串。大多数都是分成许多段、在重复区上留有空缺的草图;一个完整、无缺口的人类基因组直到 2022 年才完成。

又称
sequence assemblyde novo assembly序列组装從頭組裝