基因组学、转录组学与系统生物学

BLAST 序列比对(BLAST sequence alignment)

/ blast /

假设你找到一段神秘的 DNA 序列,想知道它是什么。最快的办法不是苦思冥想,而是去问一座庞大的图书馆:“有谁以前见过像这样的东西吗?”如果你这段未知序列与某人已经在鱼或苍蝇里研究过的某个基因高度相符,你就立刻继承了一个关于它功能的有力猜测。BLAST 就是回答这个问题的搜索引擎,它把你的序列拿去和数百万条其他序列比较。

序列比对的意思是把两条序列排齐,显出它们在哪里相同、哪里不同、哪里有字母被插入或删除,好让你衡量它们有多相似。要把这件事仔细地对一个巨大数据库中的每一条都做一遍,会慢得不可能,于是 BLAST(基本局部比对搜索工具)用了一个巧妙的捷径:它先找出你的查询序列与某条数据库条目共有的短的精确“种子”词,再只费心从那些有希望的种子向外延伸出完整的比对。它返回按比对得分排序的命中结果,并且很重要地给出一个 E 值——在这么大的数据库里,纯靠运气你预期能找到这么好的匹配有多少个。

BLAST 是整个生物学里最常用的工具之一,因为相似性是如此有力的线索:亲缘相近的序列通常共享祖先、也常常共享功能。但它的输出必须谨慎解读。低 E 值意味着一个匹配不太可能是巧合,而不是意味着这两条序列做着相同的工作——序列相似只是暗示、并不证明功能相似。短的查询序列以及重复或低复杂度的区域可能抛出误导性的命中,而一个与被错误注释的数据库条目的强匹配,会乐呵呵地把那个错标签传给你。比对找的是相像;解读相像意味着什么,仍然是你的活。

你把一个未知的人类基因拿去做 BLAST,最靠前的命中(E 值为 1e-90)是酵母里一个研究得很透彻的 DNA 修复基因——这有力地暗示你的基因也参与 DNA 修复,是一个值得检验的假设。

BLAST 能快速找到相似序列;低 E 值意味着“不太可能是偶然”,而不是“功能相同”。

一个强 BLAST 命中显示的是相像,而非功能相同,而且它可能从一条被错误注释的数据库条目那里继承错标签。E 值衡量的是偶然性,而不是生物学意义。

又称
Basic Local Alignment Search Toolsequence search序列比对序列比對