基因組學、轉錄組學與系統生物學

BLAST 序列比對(BLAST sequence alignment)

/ blast /

假設你找到一段神秘的 DNA 序列,想知道它是什麼。最快的辦法不是苦思冥想,而是去問一座龐大的圖書館:「有誰以前見過像這樣的東西嗎?」如果你這段未知序列與某人已經在魚或蒼蠅裡研究過的某個基因高度相符,你就立刻繼承了一個關於它功能的有力猜測。BLAST 就是回答這個問題的搜尋引擎,它把你的序列拿去和數百萬條其他序列比較。

序列比對的意思是把兩條序列排齊,顯出它們在哪裡相同、哪裡不同、哪裡有字母被插入或刪除,好讓你衡量它們有多相似。要把這件事仔細地對一個巨大資料庫中的每一條都做一遍,會慢得不可能,於是 BLAST(基本局部比對搜尋工具)用了一個巧妙的捷徑:它先找出你的查詢序列與某條資料庫條目共有的短的精確「種子」詞,再只費心從那些有希望的種子向外延伸出完整的比對。它返回按比對得分排序的命中結果,並且很重要地給出一個 E 值——在這麼大的資料庫裡,純靠運氣你預期能找到這麼好的匹配有多少個。

BLAST 是整個生物學裡最常用的工具之一,因為相似性是如此有力的線索:親緣相近的序列通常共享祖先、也常常共享功能。但它的輸出必須謹慎解讀。低 E 值意味著一個匹配不太可能是巧合,而不是意味著這兩條序列做著相同的工作——序列相似只是暗示、並不證明功能相似。短的查詢序列以及重複或低複雜度的區域可能拋出誤導性的命中,而一個與被錯誤註釋的資料庫條目的強匹配,會樂呵呵地把那個錯標籤傳給你。比對找的是相像;解讀相像意味著什麼,仍然是你的活。

你把一個未知的人類基因拿去做 BLAST,最靠前的命中(E 值為 1e-90)是酵母裡一個研究得很透徹的 DNA 修復基因——這有力地暗示你的基因也參與 DNA 修復,是一個值得檢驗的假設。

BLAST 能快速找到相似序列;低 E 值意味著「不太可能是偶然」,而不是「功能相同」。

一個強 BLAST 命中顯示的是相像,而非功能相同,而且它可能從一條被錯誤註釋的資料庫條目那裡繼承錯標籤。E 值衡量的是偶然性,而不是生物學意義。

又稱
Basic Local Alignment Search Toolsequence search序列比对序列比對