真核基因的結構
想像一份印在雜誌上的食譜。真正的烹飪步驟是核心,但圍繞它的還有一個告訴你食譜從哪裡開始的標題、一段引言、一些腳註,甚至排版師插入的被劃掉的批註。真核基因的排布與此很像:編碼蛋白質的那部分被各種信號和間隔序列包裹著,它們指明從哪裡開始、在哪裡停止、以及要做多少。
沿著 DNA 讀下去,一個典型的蛋白質編碼基因依次包含:啟動子(緊靠上游的「著陸跑道」,轉錄機器在此結合、轉錄在此起始),然後是被轉錄的區域。被轉錄的區域以 5' 非翻譯區(5' UTR)開始,接著外顯子(會保留進最終信使 RNA 的序列)與內含子(被轉錄但隨後通過剪接被切除的序列)交替排列,最後以攜帶加工與穩定性信號的 3' 非翻譯區(3' UTR)結束。在附近或遠處散布著增強子、沉默子等調控元件,用來調節基因被開啟的強弱。外顯子序列中只有一部分是真正的編碼區(開放閱讀框);非翻譯區會被轉錄,卻不會被翻譯。
了解這套結構至關重要,因為它解釋了一段 DNA 如何變成一個有功能的蛋白質,也解釋了為什麼突變落在不同位置後果不同——編碼區的改變可能改變蛋白質,剪接位點的改變可能打亂保留哪些外顯子,而啟動子或增強子的改變可能只是把「音量」調大或調小。它還說明了為什麼基因遠比它編碼的蛋白質長:按長度計,人類基因的大部分是內含子和調控 DNA,而非編碼序列。
人類的抗肌萎縮蛋白(dystrophin)基因在 DNA 上跨越約 240 萬鹼基對,但它最終的信使 RNA 只有約 14000 個字母長——基因的 99% 以上是會被剪接掉的內含子。它眾多的外顯子、非翻譯區和啟動子共同把一大段 DNA 變成一份可用的藍圖。
真核基因大部分是包裹著小小編碼核心的非編碼 DNA。
基因不只是編碼序列:啟動子、非翻譯區、內含子和遠處的調控元件,都是它發揮功能的一部分。而「一個基因一個蛋白質」已經過時——可變剪接讓同一個基因的外顯子被組合成幾種不同的蛋白質。