擴增、定序與核酸分析

次世代定序(next-generation sequencing)

/ NGS /

桑格定序一次讀一個DNA模板。用那種方式讀完整個人類基因組,讓一個國際聯盟花了十多年、數十億美元。一個顯而易見的問題是:如果你能不只讀一個模板,而是同時、並行地讀上百萬個模板,會怎樣?這個想法——大規模並行定序——正是「次世代定序」的含義,它把讀DNA的成本和時間壓低了好幾個數量級。

NGS不是在一管裡做一個細緻的反應,而是把DNA切成海量的短片段,固定到表面或微珠上,同時讀取所有這些片段——通常用邊合成邊定序的方式,每加上一個鹼基就閃出一個可檢測的信號。一次運行就同時產生上億到數十億條短讀長。代價是每一條單獨的讀長都很短(常為50到300鹼基)且有一定錯誤率,所以威力不來自任何單條讀長,而來自純粹的數量:同一區域被反覆讀很多遍,所有這些讀長的共識就高度可靠。軟體隨後把這股短讀長的洪流重新拼接或比對回基因和基因組。

NGS把分子生物學變成了一門數據科學。第一個人類基因組耗資數十億美元;NGS把一個人類基因組的成本拉到接近一次常規醫學檢查的水平,從而打開了測全基因組、只測蛋白編碼的外顯子組、轉錄組(RNA-seq)、腫瘤DNA、微生物群落等等的大門。誠實的說法是:NGS是規模和並行的勝利,而非讀取品質的勝利——它用短而易錯的單條讀長換取壓倒性的通量,並極大地依賴計算把原始讀長變成答案。

一次NGS運行通過同時讀取約十億條短片段(每條僅約150鹼基)來測一個人的基因組。沒有任何單條讀長覆蓋整個基因,但因為每個位置都被讀了30遍以上,軟體就能從這些重疊中拼出一個可靠、完整的基因組。

威力來自數百萬條並行的短讀長,而非一條完美的讀長。

NGS的讀長單條既短又易錯——準確性來自把每個位點讀很多遍(即覆蓋度),而非任何單條讀長,且原始輸出離開了大量的計算拼接或比對就毫無用處。

又稱
NGSmassively parallel sequencinghigh-throughput sequencing高通量测序二代測序