真核基因的结构
想象一份印在杂志上的食谱。真正的烹饪步骤是核心,但围绕它的还有一个告诉你食谱从哪里开始的标题、一段引言、一些脚注,甚至排版师插入的被划掉的批注。真核基因的排布与此很像:编码蛋白质的那部分被各种信号和间隔序列包裹着,它们指明从哪里开始、在哪里停止、以及要做多少。
沿着 DNA 读下去,一个典型的蛋白质编码基因依次包含:启动子(紧靠上游的“着陆跑道”,转录机器在此结合、转录在此起始),然后是被转录的区域。被转录的区域以 5' 非翻译区(5' UTR)开始,接着外显子(会保留进最终信使 RNA 的序列)与内含子(被转录但随后通过剪接被切除的序列)交替排列,最后以携带加工与稳定性信号的 3' 非翻译区(3' UTR)结束。在附近或远处散布着增强子、沉默子等调控元件,用来调节基因被开启的强弱。外显子序列中只有一部分是真正的编码区(开放阅读框);非翻译区会被转录,却不会被翻译。
了解这套结构至关重要,因为它解释了一段 DNA 如何变成一个有功能的蛋白质,也解释了为什么突变落在不同位置后果不同——编码区的改变可能改变蛋白质,剪接位点的改变可能打乱保留哪些外显子,而启动子或增强子的改变可能只是把“音量”调大或调小。它还说明了为什么基因远比它编码的蛋白质长:按长度计,人类基因的大部分是内含子和调控 DNA,而非编码序列。
人类的抗肌萎缩蛋白(dystrophin)基因在 DNA 上跨越约 240 万碱基对,但它最终的信使 RNA 只有约 14000 个字母长——基因的 99% 以上是会被剪接掉的内含子。它众多的外显子、非翻译区和启动子共同把一大段 DNA 变成一份可用的蓝图。
真核基因大部分是包裹着小小编码核心的非编码 DNA。
基因不只是编码序列:启动子、非翻译区、内含子和远处的调控元件,都是它发挥功能的一部分。而“一个基因一个蛋白质”已经过时——可变剪接让同一个基因的外显子被组合成几种不同的蛋白质。