基因組學、轉錄組學與系統生物學
參考基因組(reference genome)
當你給一份文件拍照時,手頭若有一份乾淨的母版會幫上大忙。要檢查你的照片上有沒有污點,你不會從頭把整頁重讀一遍——你會把它對齊到母版,只看兩者不同的地方。在基因組學裡,那份公認的、屬於某個物種的 DNA 母版就是參考基因組,而這個領域幾乎一切都是靠和它比對來讀取的。
參考基因組是為某個物種精心組裝、品質很高的代表性序列,由學界共同維護和更新,充當一套共享的座標系統。它真正的威力在於:一旦它存在,你就不再需要從零組裝每一個新個體。你把一個新個體的 DNA 測成短讀段,只需把每條讀段比對(map)到參考上它對應的位置即可,這比從無到有地建一個基因組容易得多。讀段與參考之間的差異——這裡換了一個字母、那裡缺了一段——會被記錄為該個體的變異,而這份精簡的差異清單,正是大多數基因組學真正研究的對象。
問題在於參考只是一個代表,而非普世真理。人類參考基因組是少數幾個人的拼合體,歷史上偏向少數幾個人群,因此在代表性不足的群體中常見的 DNA,可能在它裡面完全缺失,導致一些讀段比對得很差、或某些變異看上去「異常」僅僅是因為參考不完整。這個領域正轉向泛基因組(pangenome)——一次性用許多不同個體構建的參考——正是為了修正這一點。把任何單一參考當成某物種「那一個」基因組、或當成正常的標準,都是一個真實而後果嚴重的錯誤。
為了找出一個人的變異,軟體把他的讀段比對到人類參考基因組上,並把差異報告成精簡的條目,比如「7 號染色體,第 117559590 位,C 變成 T」,而不是把全部 32 億個鹼基都重新存一遍。
參考基因組是一套共享座標系;個體基因組以與它的差異來記錄。
參考基因組是一個代表,而不是「正常」的標準。它偏向於構建它的那些人,這正是如今要採用多樣化泛基因組的原因。
又稱
另見