扩增、测序与核酸分析

测序读长(sequencing read)

测序仪不会把一整条染色体一次性拼好交给你。它交给你的是一大堆短的、各自被解码出来的片段——每一段都是某一条DNA片段上字母的序列。这些单独的片段中的每一条就叫一条读长(read)。读长是几乎所有测序技术的基本单位、原始输出。

测序时,样品被打成片段,仪器尽其所能地测定每个片段的碱基序列。一条读长就是为一个片段读出的那串被判读的碱基——例如AGCTTAGGCA……——通常每个碱基还附带一个质量分数,表明这次判读有多大把握。短读长平台的读长通常50到300碱基;长读长平台(如纳米孔)的读长可达上万碱基。读长可以是单端(一个片段,从一个方向读)或双端(同一片段从两端各读一遍,有助于软件弄清各片段如何拼接)。

读长是基因组学的拼图块。单凭它们,十亿条短读长不过是一地碎纸;价值来自你拿它们做什么——把它们比对到参照基因组以找出变异,或靠它们的重叠拼装出一个新基因组。明白原始数据是一堆短而不完美的读长(而非一个完成的基因组),是诚实解读基因组学结论的关键:有多少条读长、有多长、有多准、对每个位点覆盖得多深,全都左右着哪些结论值得信赖。

一次短读长运行输出形如AGCTTAGGCATCG(每条150碱基)的读长,每条都标有质量分数。日后,数十亿条这样彼此重叠的读长被软件比对或拼装成一个基因或基因组的连续序列。

一条读长 = 一个DNA片段被解码出的序列。

一条读长不是完成的基因组,而是单个短而不完美的数据点——有意义的结论只有在许多读长被比对或拼装到一起之后才出现,所以读长的数量、长度、准确度和深度,与序列本身同样重要。

又称
readDNA read读段讀段