基因组注释(genome annotation)
假设有人递给你一本三十亿个字母的书,印出来时没有空格、没有标点、没有章节标题——只是一串不间断的字母。知道全部字母,并不等于知道这本书在讲什么。你还得找出词与句从哪里开始、到哪里结束,标出哪些段落有意义、哪些是填充物,并给每一部分贴上它的作用。对一段原始基因组序列做这件事,就是基因组注释。
注释是寻找并标注序列内部各种特征的过程:基因从哪里开始、到哪里结束,哪些区段是外显子、哪些是内含子,启动子之类的调控信号位于何处,以及每个基因的蛋白产物大概有什么功能。计算机先做第一遍,搜寻各种标志性模式——读码框中的起始与终止密码子、外显子边界上的剪接信号、能区分编码与非编码 DNA 的统计特征——然后大量依赖比对:如果某一段与另一种生物中功能已知的基因高度相似,就把那个功能暂时套用过来。实验数据,尤其是显示哪些部分确实被转录的 RNA-seq,会为预测提供锚点并加以校正。
注释之所以重要,是因为一段光秃秃的序列没有它几乎毫无用处;但它也是基因组学中最容易出错、永远做不完的环节之一。基因预测在边界处常常出错,又短又特殊的基因会被漏掉,从其他物种套来的功能标签可能是错的、并把同一个错误传遍许多数据库。这就是为什么注释带有版本号和置信等级,为什么一个基因被标出的功能是一个假设而非事实,也是为什么人类基因数目曾被高估多年,最后才稳定在约两万个蛋白编码基因。
一条注释流程扫描一份新基因组,找到一个带有正确起始与终止密码子的开放阅读框,其预测蛋白与小鼠中一种已知激酶高度相似,便把这一区域标为“预测的蛋白激酶”——这是一个有待验证的假设,而不是已被证明的事实。
注释把原始字母变成带标签的特征,但每个标签都是一个可检验的论断。
一个基因被注释出的功能是一项预测,往往靠与另一物种的相似性得出,而非已证明的事实。错误标签可能在数据库间传播,因此注释带有版本和置信等级。