基因组组织与染色质

C 值悖论

/ SEE-value /

如果说 DNA 是生命的说明书,你大概会猜:越精巧的生物需要越厚的书。C 值悖论正是这样一个出人意料的发现——事实根本不是如此。每个基因组所含的 DNA 量(即“C 值”)在物种之间剧烈变化,而这种变化无视它们看上去有多复杂。

这个悖论有两层。第一,两个复杂程度相近的生物,基因组大小可以相差悬殊——某些单细胞变形虫携带的 DNA 远多于人类。第二,一个生物的总 DNA 量并不能预测它的基因数目。谜底在我们能够测序基因组之后才揭开:真核生物的大部分 DNA 根本不是编码基因的序列,而是内含子、调控区,以及最主要的——重复序列和来自转座子的 DNA。因此较大的 C 值通常意味着更多的非编码“填充物”,而不是更多的指令。例如,人类只有约两万个蛋白质编码基因,比某些植物和线虫还少。

如今生物学家常更倾向用“C 值之谜”这个说法,因为真正的问题已不再是“为什么 DNA 量不随复杂程度变化”(我们已知大部分是非编码的),而是“为什么非编码的量差异如此之大,这种差异又是否重要”。它在真实生物学中确实重要,因为多余的 DNA 仍有代价和影响——影响细胞体积、复制时间,以及那些增添或修剪序列的进化力量。这个悖论是一个永久的提醒:数 DNA 不等于数功能。

单细胞的变形虫 Polychaos dubium 曾被测出基因组大小超过人类的两百倍。即便考虑测量误差,结论依然成立:一个“简单”的变形虫在 DNA 量上可以远超人类,而基因数目却并不更多。

DNA 量与生物复杂程度脱钩——这正是 C 值悖论的核心。

一旦把编码 DNA 与非编码 DNA 区分开,悖论就化解了:复杂程度大致与受调控的基因使用方式相关,而非与 DNA 的原始数量相关。数基因而非数碱基对才是更好的参照——而即便是基因数目,也只是复杂程度的不完美替代指标。

又称
C-value enigmaC 值之谜C 值之謎