基因組學、轉錄組學與系統生物學

基因組組裝(genome assembly)

想像你拿來十本一模一樣的厚書,把每一本都送進碎紙機,再把所有碎片混在一起。沒有一片碎紙是編了號的,而且很多看起來都差不多。你的任務是只憑一個線索把整本書按順序還原出來:凡是兩片碎紙在撕裂的邊緣上有一段相同的字句,它們很可能本來就緊挨在一起。把這個拼圖放大到幾十億個 DNA 字母,就是基因組組裝。

定序儀並不會把一條染色體從頭讀到尾。它讀出的是海量的、彼此重疊的短片段,稱為讀段(reads)。基因組組裝就是用計算把這些讀段重新縫合成它們原本所在的那條長序列。軟體去尋找重疊——一個讀段的末尾與另一個讀段的開頭相吻合的地方——再把它們合併成更長的片段,就像你把邊緣對得上的碎片拼在一起。由於每個區域都被讀到很多次(即覆蓋度),重疊足夠密集,能找出真正的順序;而對同一處反覆讀取,也讓程式能把隨機的定序錯誤投票剔除。

組裝之所以困難,正是因為真實的基因組充滿了重複序列:同一段長文字出現在許多地方,就像同一句話印在上百個不同的頁面上。一個落在重複區裡的短讀段,可能來自其中任何一份拷貝,於是組裝程式無法判斷它該放在哪裡,重建就此卡住或塌成一團亂麻。這就是為什麼現代專案會把又短又準的讀段和能橫跨重複區的長讀段混合使用,也是為什麼沒有哪份組裝是真正完工的——大多數已發表的基因組都是帶空缺的草圖,而一個真正沒有缺口、從端粒到端粒的完整人類基因組直到 2022 年才完成。

面對數百萬條讀段,組裝程式發現以 ...GATTACA 結尾的讀段 A 與以 GATTACA... 開頭的讀段 B 相重疊,便把它們連起來,如此重複數百萬次,直到短讀段長成一段段重建好的長染色體序列。

組裝把重疊的讀段合併成越來越長的序列,但在重複區上會遇到障礙。

一個「已定序」的基因組很少是一條完美無缺的字串。大多數都是分成許多段、在重複區上留有空缺的草圖;一個完整、無缺口的人類基因組直到 2022 年才完成。

又稱
sequence assemblyde novo assembly序列组装從頭組裝