序列資料庫(GenBank)與格式(sequence databases and formats)
/ JEN-bank /
科學只有在發現被分享時才會層層累積,而在基因組學裡,這種分享是透過龐大的公共序列倉庫實現的。當一個實驗室測定了一個新基因或新基因組,它會把這段序列存入一個資料庫,地球上任何人都能免費搜尋和下載。正是這座不斷累積的圖書館,才使得一次 BLAST 搜尋能認出你那個未知基因——它是在和幾十年來所有人存入的工作做比較。
GenBank 由美國 NIH 營運(並由歐洲和日本的夥伴資料庫鏡像),是這些檔案庫中最著名的:一個龐大且不斷增長的公開 DNA 和 RNA 序列集合,連同它們的註釋和背後的論文。為了把這些資料搬來搬去,這個領域依賴幾種純文字格式。FASTA 最簡單:一行以符號 > 開頭的標題,給出序列的名字,後面跟著原始字母,比如一行是 '>my_gene'、下一行是 'ATGGCGTTAC...'。FASTQ 在此基礎上為定序讀段做了擴展,給每個鹼基都附上一個品質分數,表示機器對那個字母有多大把握。還有像 SAM/BAM 這樣的格式記錄讀段比對到哪裡,VCF 則記錄變異。
這些資源和格式是讓現代生物學得以互通的、安靜的基礎設施——一段在東京存入的序列,一小時後就能在聖保羅被分析。但誠實的告誡很重要:公共資料庫只受到輕度的審編,所以裡面含有錯誤、來自其他生物的汙染,以及過時或錯誤的註釋,當人們照抄時這些就會傳播開來。一段序列出現在 GenBank 裡,只意味著有人提交了它,而不意味著它是正確的,這又是一個理由說明結果需要獨立核查,而不是盲目相信下載來的標籤。
一條 FASTA 記錄長這樣:第一行是 '>BRCA1 partial sequence'、下一行是 'ATGGATTTATCTGCTCTTCGCGTT...'——只有一個名字和那些字母,這就是讓任何程式都能讀懂任何序列的通用語。
GenBank 儲存著全世界的序列;像 FASTA 這樣簡單的格式讓任何工具都能讀取它們。
公共資料庫只受輕度審編。一段序列在 GenBank 裡只意味著有人提交了它,而非它正確——錯誤、汙染和過時註釋很常見,並會被一路照抄下去。