基因组学、转录组学与系统生物学
参考基因组(reference genome)
当你给一份文件拍照时,手头若有一份干净的母版会帮上大忙。要检查你的照片上有没有污点,你不会从头把整页重读一遍——你会把它对齐到母版,只看两者不同的地方。在基因组学里,那份公认的、属于某个物种的 DNA 母版就是参考基因组,而这个领域几乎一切都是靠和它比对来读取的。
参考基因组是为某个物种精心组装、质量很高的代表性序列,由学界共同维护和更新,充当一套共享的坐标系统。它真正的威力在于:一旦它存在,你就不再需要从零组装每一个新个体。你把一个新个体的 DNA 测成短读段,只需把每条读段比对(map)到参考上它对应的位置即可,这比从无到有地建一个基因组容易得多。读段与参考之间的差异——这里换了一个字母、那里缺了一段——会被记录为该个体的变异,而这份精简的差异清单,正是大多数基因组学真正研究的对象。
问题在于参考只是一个代表,而非普世真理。人类参考基因组是少数几个人的拼合体,历史上偏向少数几个人群,因此在代表性不足的群体中常见的 DNA,可能在它里面完全缺失,导致一些读段比对得很差、或某些变异看上去“异常”仅仅是因为参考不完整。这个领域正转向泛基因组(pangenome)——一次性用许多不同个体构建的参考——正是为了修正这一点。把任何单一参考当成某物种“那一个”基因组、或当成正常的标准,都是一个真实而后果严重的错误。
为了找出一个人的变异,软件把他的读段比对到人类参考基因组上,并把差异报告成精简的条目,比如“7 号染色体,第 117559590 位,C 变成 T”,而不是把全部 32 亿个碱基都重新存一遍。
参考基因组是一套共享坐标系;个体基因组以与它的差异来记录。
参考基因组是一个代表,而不是“正常”的标准。它偏向于构建它的那些人,这正是如今要采用多样化泛基因组的原因。
又称
另见