人类基因组计划(Human Genome Project)
/ HGP /
想象你打算把一个人的整本说明书一个字母、一个字母地写下来。这就是人类基因组计划:一项大致从1990年持续到2003年的国际工程,目标是第一次读出人类DNA全部三十亿个碱基对的序列。它是生物学史上规模最大的协作工程之一,其雄心可与登月相提并论。
这项工作意味着:把基因组拆成一块块便于处理的片段,用当时的化学方法给每一块测序,再用计算把这些片段拼回正确的顺序——就像把同一本巨著的许多份被撕碎的副本重新拼合起来。一个由公共经费资助的联盟,与一家名叫塞莱拉(Celera)的私营公司,平行竞赛,在2000年宣布了一份工作草图,并在2003年给出了更完整的版本。最引人注目的意外是基因的数目:人类原来只有大约两万个蛋白质编码基因,远少于许多人预期的十万个,也并不比一条线虫多多少,这迫使人们重新思考复杂性究竟从何而来。
它的遗产重塑了整个领域。它创造出后来所有人类DNA研究都用以对照的参考基因组,推动了让测序便宜、快上千倍的技术,并开创了基因组学和个性化医疗。但它也教会人们谦卑:拿到序列只是开始,而不是结束。基因组的大部分是非编码的,至今仍在被破译;而读出这些字母,对“如何治愈疾病”的启示远比我们期望的少——因为知道零件清单,并不等于理解了这台机器。
第一个人类基因组耗资约三十亿美元,花了十多年。今天,多亏了那个计划催生的技术,一个人类基因组大约一天就能测完,花费只要几百美元。
从三十亿美元到几百美元——这个计划最深远的遗产,是廉价的测序。
2003年那个“完成”的基因组其实并不真正完整:那些困难、高度重复的区域一直悬而未决,直到2022年,端粒到端粒(Telomere-to-Telomere)联盟才补上了最后的缺口。即便到今天,“人类基因组”也是一份参考序列,而不是任何一个真实个人的DNA。