重疊群與支架(contigs and scaffolds)
當你重組那本被碎掉的書時,你很少能一氣呵成地把整本拼回來。更常見的是,你拼出幾段又長又確信的文字——你確定是連續讀下去的段落——它們之間夾著一些地方,那裡要麼碎片用盡,要麼混亂得無法放置。即使這些模糊的空缺還沒填上,知道那幾段確信文字的先後順序、以及它們之間空缺大致有多大,仍然極其有用。基因組組裝恰好產出這兩個層次,分別叫做重疊群(contig)和支架(scaffold)。
重疊群是組裝程式無缺口地重建出的一段連續序列——重疊的讀段被合併成一串不間斷的字母。但重複序列和缺失的資料會在重疊群之間留下斷點。支架是更高一層:它給一組重疊群排好順序和方向,並記錄它們之間空缺的大致長度,即便那些空缺裡的確切字母仍屬未知。這些空缺通常寫成一連串字母 N,作為佔位符,意思是「我們大致知道這裡有這麼多個鹼基,但不知道是哪些」。把它們連起來的資訊來自一些線索,比如成對讀段——它們的兩端落在不同的重疊群裡,且兩端之間的距離是已知的。
這個兩層的圖景就是大多數已發表基因組誠實的實情。「染色體級」組裝意味著支架長到足以橫跨整條染色體;而「草圖」基因組可能是幾千個重疊群、分布在許多短支架裡。重疊群和支架的數目與大小——常用一個叫 N50 的統計量來概括——正是生物學家判斷一份組裝品質的依據。理解這個區別很重要,因為一個挨著空缺、或被劈成兩個重疊群的基因,可能被數錯或乾脆被漏掉,所以組裝品質直接決定了你能信任哪些結論。
一份組裝可能報告說有 200 個重疊群被連成 12 個支架;在一個支架裡你可能看到 ...ACGTTGA NNNNNNNNNN GCATTACG...,其中那串 N 標記著一個大約 10 個鹼基的空缺,它的位置已知,但具體字母未知。
重疊群是無缺口的連續段;支架則在以 N 標記的空缺之間給重疊群排序。
基因組檔案裡一長串 N 並不是真實序列——它是一個估計長度的空缺。把 N 串當成資料是初學者的典型錯誤。