编码与非编码 DNA(C 值悖论)
/ KOH-ding VER-sus non-KOH-ding DEE-en-AY /
如果一个基因组里除了食谱什么都没有,你大概会以为越复杂的生物就需要越厚的菜谱。但自然界充满了意外:洋葱的基因组大约是人类的五倍大,而某些变形虫的 DNA 量是我们的几百倍。基因组大小为什么并不随一个生物看起来有多复杂而变化,这个谜题被称为 C 值悖论——要解开它,得从编码 DNA 与非编码 DNA 的区别说起。
编码 DNA 是一个基因中真正拼出某种蛋白质氨基酸序列的那一部分——也就是字面意义上的食谱正文。非编码 DNA 则是除此之外的一切:控制基因何时开启的开关和旋钮、制造功能性 RNA 分子的指令、像着丝粒和端粒这样的结构性区域、残留的坏掉的基因,以及大段大段重复的序列。在人类中,只有大约 1% 到 2% 的基因组是编码蛋白质的;绝大多数都是非编码的。一旦你意识到基因组的大部分体量都是非编码 DNA、而其多少在物种之间因与复杂性无关的原因而天差地别,C 值悖论也就迎刃而解了。
把非编码 DNA 叫作“垃圾”很有诱惑力,其中有一些或许确实是寄生性的、或是惰性的填充物。但事实证明这个标签太过笼统:大部分非编码 DNA 都担负着重要的工作——调控基因、塑造染色体结构、产生调控性 RNA。诚实的当前观点是一道光谱:有些非编码 DNA 显然是有功能的,有些很可能是无用的累赘,而对其中很大一部分,我们干脆就还不知道。
一颗不起眼的洋葱携带着大约 160 亿对碱基的 DNA——大约是人类基因组的五倍——可没人会说洋葱比人复杂五倍。它多出来的 DNA 大多是重复的非编码序列。
洋葱的考验:DNA 更多,并不意味着更复杂。
要避免“垃圾 DNA”这个一刀切的说法:非编码并不等于无功能——很多非编码 DNA 在调控基因,而剩下的那部分究竟有多少是真正无用的,至今仍存在真切的争议。