扩增、测序与核酸分析

下一代测序(next-generation sequencing)

/ NGS /

桑格测序一次读一个DNA模板。用那种方式读完整个人类基因组,让一个国际联盟花了十多年、数十亿美元。一个显而易见的问题是:如果你能不只读一个模板,而是同时、并行地读上百万个模板,会怎样?这个想法——大规模并行测序——正是“下一代测序”的含义,它把读DNA的成本和时间压低了好几个数量级。

NGS不是在一管里做一个细致的反应,而是把DNA切成海量的短片段,固定到表面或微珠上,同时读取所有这些片段——通常用边合成边测序的方式,每加上一个碱基就闪出一个可检测的信号。一次运行就同时产生上亿到数十亿条短读长。代价是每一条单独的读长都很短(常为50到300碱基)且有一定错误率,所以威力不来自任何单条读长,而来自纯粹的数量:同一区域被反复读很多遍,所有这些读长的共识就高度可靠。软件随后把这股短读长的洪流重新拼接或比对回基因和基因组。

NGS把分子生物学变成了一门数据科学。第一个人类基因组耗资数十亿美元;NGS把一个人类基因组的成本拉到接近一次常规医学检查的水平,从而打开了测全基因组、只测蛋白编码的外显子组、转录组(RNA-seq)、肿瘤DNA、微生物群落等等的大门。诚实的说法是:NGS是规模和并行的胜利,而非读取质量的胜利——它用短而易错的单条读长换取压倒性的通量,并极大地依赖计算把原始读长变成答案。

一次NGS运行通过同时读取约十亿条短片段(每条仅约150碱基)来测一个人的基因组。没有任何单条读长覆盖整个基因,但因为每个位置都被读了30遍以上,软件就能从这些重叠中拼出一个可靠、完整的基因组。

威力来自数百万条并行的短读长,而非一条完美的读长。

NGS的读长单条既短又易错——准确性来自把每个位点读很多遍(即覆盖度),而非任何单条读长,且原始输出离开了大量的计算拼接或比对就毫无用处。

又称
NGSmassively parallel sequencinghigh-throughput sequencing高通量测序二代測序