基因组组织与染色质

编码 DNA 与非编码 DNA

翻开一本厚厚的工具书,你会发现只有部分页面承载着正文条目;其余是索引、交叉引用、空白分隔页,以及如何使用本书的说明。基因组也类似。只有一小片 DNA 拼写出蛋白质的配方;绝大多数在做别的事——或者在某些地方,做着我们尚未识别出的事。

编码 DNA 是那些以三联体(密码子)被读取、并翻译成蛋白质氨基酸的序列——也就是外显子内的开放阅读框。在人类基因组中,这部分小得惊人:32 亿碱基对中,真正编码蛋白质的只有约 1% 到 2%。其余全是非编码 DNA。这个类别并不均一:它包括启动子、增强子和其他调控开关;内含子;那些被转录成有功能却从不被翻译的 RNA(核糖体 RNA、转运 RNA、微 RNA、长非编码 RNA)的 DNA;着丝粒和端粒的结构序列;以及大片重复序列和来自转座子的 DNA。

这一区分之所以重要,是因为它重塑了我们对基因组工作方式的理解。功能并不局限于编码的那 1% 到 2%。非编码基因组中很大一部分是调控性的——决定基因在何时何处开启——而全基因组研究中发现的、与疾病相关的变异,往往落在非编码的调控 DNA 中,而非落在基因里。所以“非编码”意味着“不编码蛋白质”,而非“什么都不做”。非编码基因组究竟有多大比例真正具有功能、又有多少只是附带,至今仍是一个活跃、有时激烈的科学争论。

在人类基因组约 32 亿碱基对中,只有约 5000 万到 6000 万(1% 到 2%)直接编码蛋白质。其余 98% 以上包含着各种开关,决定这些蛋白质中哪些被制造、在何处、在何时。

人类 DNA 只有 1% 到 2% 编码蛋白质;其余承担着其他重要工作。

“非编码”并不等于“无用”。许多非编码 DNA 是调控性、结构性的,或被转录成有功能的 RNA——不过也确实并非每一个非编码碱基都有已知功能,真正重要的比例仍存争议。

又称
protein-coding vs non-coding编码与非编码編碼與非編碼