基因組註釋(genome annotation)
假設有人遞給你一本三十億個字母的書,印出來時沒有空格、沒有標點、沒有章節標題——只是一串不間斷的字母。知道全部字母,並不等於知道這本書在講什麼。你還得找出詞與句從哪裡開始、到哪裡結束,標出哪些段落有意義、哪些是填充物,並給每一部分貼上它的作用。對一段原始基因組序列做這件事,就是基因組註釋。
註釋是尋找並標註序列內部各種特徵的過程:基因從哪裡開始、到哪裡結束,哪些區段是外顯子、哪些是內含子,啟動子之類的調控信號位於何處,以及每個基因的蛋白產物大概有什麼功能。電腦先做第一遍,搜尋各種標誌性模式——讀碼框中的起始與終止密碼子、外顯子邊界上的剪接信號、能區分編碼與非編碼 DNA 的統計特徵——然後大量依賴比對:如果某一段與另一種生物中功能已知的基因高度相似,就把那個功能暫時套用過來。實驗資料,尤其是顯示哪些部分確實被轉錄的 RNA-seq,會為預測提供錨點並加以校正。
註釋之所以重要,是因為一段光禿禿的序列沒有它幾乎毫無用處;但它也是基因組學中最容易出錯、永遠做不完的環節之一。基因預測在邊界處常常出錯,又短又特殊的基因會被漏掉,從其他物種套來的功能標籤可能是錯的、並把同一個錯誤傳遍許多資料庫。這就是為什麼註釋帶有版本號和置信等級,為什麼一個基因被標出的功能是一個假設而非事實,也是為什麼人類基因數目曾被高估多年,最後才穩定在約兩萬個蛋白編碼基因。
一條註釋流程掃描一份新基因組,找到一個帶有正確起始與終止密碼子的開放閱讀框,其預測蛋白與小鼠中一種已知激酶高度相似,便把這一區域標為「預測的蛋白激酶」——這是一個有待驗證的假設,而不是已被證明的事實。
註釋把原始字母變成帶標籤的特徵,但每個標籤都是一個可檢驗的論斷。
一個基因被註釋出的功能是一項預測,往往靠與另一物種的相似性得出,而非已證明的事實。錯誤標籤可能在資料庫間傳播,因此註釋帶有版本和置信等級。