生物信息学(bioinformatics)
/ BY-oh-in-fer-MAT-iks /
单个人类基因组约有 32 亿个字母,一次测序运行产出上亿条读段,一次单细胞实验产出含有数百万个数字的表格。没有谁会用肉眼去读这些。生物信息学正是用计算机和统计学,在这种规模上去存储、搜索、比较并读懂生物数据的学科——它是每一项基因组尺度实验不可或缺的伙伴,是原始数据变成生物学的那个环节。
在实践中,生物信息学是支撑这个领域里其他一切的工具箱与思维方式。它包括把一条序列比对到另一条、或组装一个基因组的算法,存储序列并让全世界检索它们的数据库,承载数据的文件格式,以及至关重要的——判断一个模式是真实的还是只是噪音的统计学。当你一次测量两万个基因、问哪些在某疾病中发生了变化时,你是在同时检验两万个假设,单凭运气就会有许多看上去“显著”;生物信息学提供多重检验校正与对照,让你不至于自欺。
生物信息学之所以重要,是因为现代分子生物学如今既是湿实验科学、也同样是数据科学——许多发现完全是在键盘前、靠重新分析公开数据做出的。但它的结果只在它的假设可信时才可信:一条聪明的流程跑在有偏的输入上,用了错误的统计模型、或一个没说明的参数选择,照样能产出自信满满的胡话。这就是为什么这个领域非常看重可重复性——共享数据、代码和确切方法——好让一个计算上的论断,和任何科学论断一样,能被别人核查。在这里,“垃圾进、垃圾出”不是玩笑,而是核心风险。
一项 RNA-seq 研究在某疾病中发现 1000 个基因“显著改变”;在对“一次检验上千个基因”做校正之后,只剩下 80 个站得住——这是一个清醒的提醒:没有恰当的统计,最初那张清单里大部分都是噪音。
生物信息学是数据变成生物学的地方——也是用好的统计把信号从噪音中分出来的地方。
再精巧的流程也救不了糟糕的数据或错误的统计模型——垃圾进、垃圾出。一次检验成千上万个特征时必须做多重检验校正,否则噪音会冒充发现。