基因组学、转录组学与系统生物学

序列数据库(GenBank)与格式(sequence databases and formats)

/ JEN-bank /

科学只有在发现被分享时才会层层累积,而在基因组学里,这种分享是通过庞大的公共序列仓库实现的。当一个实验室测定了一个新基因或新基因组,它会把这段序列存入一个数据库,地球上任何人都能免费搜索和下载。正是这座不断累积的图书馆,才使得一次 BLAST 搜索能认出你那个未知基因——它是在和几十年来所有人存入的工作做比较。

GenBank 由美国 NIH 运营(并由欧洲和日本的伙伴数据库镜像),是这些档案库中最著名的:一个庞大且不断增长的公开 DNA 和 RNA 序列集合,连同它们的注释和背后的论文。为了把这些数据搬来搬去,这个领域依赖几种纯文本格式。FASTA 最简单:一行以符号 > 开头的标题,给出序列的名字,后面跟着原始字母,比如一行是 '>my_gene'、下一行是 'ATGGCGTTAC...'。FASTQ 在此基础上为测序读段做了扩展,给每个碱基都附上一个质量分数,表示机器对那个字母有多大把握。还有像 SAM/BAM 这样的格式记录读段比对到哪里,VCF 则记录变异。

这些资源和格式是让现代生物学得以互通的、安静的基础设施——一段在东京存入的序列,一小时后就能在圣保罗被分析。但诚实的告诫很重要:公共数据库只受到轻度的审编,所以里面含有错误、来自其他生物的污染,以及过时或错误的注释,当人们照抄时这些就会传播开来。一段序列出现在 GenBank 里,只意味着有人提交了它,而不意味着它是正确的,这又是一个理由说明结果需要独立核查,而不是盲目相信下载来的标签。

一条 FASTA 记录长这样:第一行是 '>BRCA1 partial sequence'、下一行是 'ATGGATTTATCTGCTCTTCGCGTT...'——只有一个名字和那些字母,这就是让任何程序都能读懂任何序列的通用语。

GenBank 存储着全世界的序列;像 FASTA 这样简单的格式让任何工具都能读取它们。

公共数据库只受轻度审编。一段序列在 GenBank 里只意味着有人提交了它,而非它正确——错误、污染和过时注释很常见,并会被一路照抄下去。

又称
GenBankFASTAFASTQ序列数据库序列資料庫