基因組學、轉錄組學與系統生物學

生物資訊學(bioinformatics)

/ BY-oh-in-fer-MAT-iks /

單個人類基因組約有 32 億個字母,一次定序運行產出上億條讀段,一次單細胞實驗產出含有數百萬個數字的表格。沒有誰會用肉眼去讀這些。生物資訊學正是用電腦和統計學,在這種規模上去儲存、搜尋、比較並讀懂生物資料的學科——它是每一項基因組尺度實驗不可或缺的夥伴,是原始資料變成生物學的那個環節。

在實踐中,生物資訊學是支撐這個領域裡其他一切的工具箱與思維方式。它包括把一條序列比對到另一條、或組裝一個基因組的演算法,儲存序列並讓全世界檢索它們的資料庫,承載資料的檔案格式,以及至關重要的——判斷一個模式是真實的還是只是雜訊的統計學。當你一次測量兩萬個基因、問哪些在某疾病中發生了變化時,你是在同時檢驗兩萬個假設,單憑運氣就會有許多看上去「顯著」;生物資訊學提供多重檢驗校正與對照,讓你不至於自欺。

生物資訊學之所以重要,是因為現代分子生物學如今既是濕實驗科學、也同樣是資料科學——許多發現完全是在鍵盤前、靠重新分析公開資料做出的。但它的結果只在它的假設可信時才可信:一條聰明的流程跑在有偏的輸入上,用了錯誤的統計模型、或一個沒說明的參數選擇,照樣能產出自信滿滿的胡話。這就是為什麼這個領域非常看重可重複性——共享資料、程式碼和確切方法——好讓一個計算上的論斷,和任何科學論斷一樣,能被別人核查。在這裡,「垃圾進、垃圾出」不是玩笑,而是核心風險。

一項 RNA-seq 研究在某疾病中發現 1000 個基因「顯著改變」;在對「一次檢驗上千個基因」做校正之後,只剩下 80 個站得住——這是一個清醒的提醒:沒有恰當的統計,最初那張清單裡大部分都是雜訊。

生物資訊學是資料變成生物學的地方——也是用好的統計把信號從雜訊中分出來的地方。

再精巧的流程也救不了糟糕的資料或錯誤的統計模型——垃圾進、垃圾出。一次檢驗成千上萬個特徵時必須做多重檢驗校正,否則雜訊會冒充發現。

又稱
computational biology生物信息生物資訊