ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

测序平台怎么选?Sanger、二代与三代测序原理及场景对比

测序平台怎么选?Sanger、二代与三代测序原理及场景对比 做分子实验的人几乎都会遇到同一个问题手里的样本到底该用哪种测序平台Sanger、Illumina还是PacBio/ONT我刚入行那会儿也天真地以为“三代测序”一定全面碾压“二代”直到真金白银跑了几轮数据才明白这个想法错得离谱。称呼里有“代际”不代表着技术上的取代关系更多是技术路线和适用场景的差异。这篇文章我不打算讲教科书式的定义而是从实际做项目的角度出发把一代、二代、三代测序的核心原理、优缺点和具体应用场景对比清楚希望能帮你少走点弯路。1. 三代测序到底是哪三代先建立全局认知1.1 从片段验证到大规模并行再到单分子长读长很多刚接触测序的人会被“一代、二代、三代”这个叫法绕晕其实这个代际划分背后反映的是测序能力的一次次跃迁。一代测序指的是Sanger测序上世纪70年代由Frederick Sanger发明核心思路是“合成终止电泳分离”一次只能测一条几百碱基的片段但准确率极高。二代测序NGS则是把测序搬到了“大规模并行”的轨道上能把整个基因组打成小片段后同时测几百万甚至几十亿条序列通量和成本因此发生了数量级变化Illumina是这个领域的代表。三代测序则是走向“单分子实时测序”代表性平台是PacBio的SMRT和Oxford Nanopore的纳米孔测序它们不需要PCR扩增直接对单条DNA分子进行测序读长可以做到几万甚至上百万碱基。套用一句行业里的玩笑话一代是“手工精修”二代是“工厂流水线”三代是“读长自由”。这比喻不完美但能帮你快速建立直觉。一代测序像是用一把尺子精确量一条短绳二代是同时量几百万条短绳而三代则是一把长长的卷尺一条长绳从头拉到尾也不怕断。1.2 为什么不能只用“代数新老”来判断好坏这里我想先说一个容易被误解的点——很多人觉得“三代肯定比二代先进结果更可靠”这个判断在真实项目中经常害人。举个最简单的例子临床遗传病检测中如果一个二代测序panel发现了一个候选致病突变最终确认往往还要用一代Sanger测序做验证因为Sanger准确率高、结果直观是公认的“金标准”。有些实验室如果只用二代结果直接出报告评审和临床医生大概率会要求补充Sanger验证。反过来如果你要做一个大基因组的从头组装用二代短读长去拼遇到重复序列区域经常直接断掉这时候又得靠三代长读长来跨过“重复序列天堑”。所以本质上一套成熟的测序策略从来不是“选最先进的平台”而是“选能把数据问题解决掉、成本还可控的平台”。接下来的章节我会分别把三代技术各自的优缺点和应用场景掰开揉碎讲清楚。2. 一代测序老而弥坚的“金标准”2.1 Sanger测序的原理用一个例子讲透一代测序的原理用一句话概括就是“让DNA合成在不同位置停下来再按长度把片段分组”。具体来说测序反应中除了正常的脱氧核苷酸dNTP还会掺入一定比例经过荧光标记的双脱氧核苷酸ddNTP。这种ddNTP一旦被DNA聚合酶接上由于缺少3’-OH基团链就无法继续延伸于是反应体系里就产生了“终止在各种不同长度”的DNA片段混合物。这些片段经过毛细管电泳时会按照长度由短到长依次排列而每个片段末端带有的荧光颜色就对应着该位置的碱基类型。检测器扫描这些荧光信号软件再把颜色翻译成A、T、C、G序列。整个过程像什么呢就像你让一群人从同一起点出发每走一步都有一定概率被叫停最后让所有人按走了多少步排队再根据每个人身上挂着的不同颜色标签反推出每一步的“标准动作”是什么。虽然有更新式的自动化方案但核心原理至今没有变过。这也是为什么Sanger测序的结果非常稳定可靠——因为它是“直接读”的单碱基延伸信号不经过大规模并行数据的后期拼接和误差修正。2.2 一代测序的优势和明显短板先看优点。第一准确性极高单碱基准确率通常能到99.999%以上有些高质量图谱可以达到99.9999%。在检测单个位点突变时Sanger基本就是“终审法官”。第二读长相对不错一条反应通常能测600到1000个碱基这个长度在验证小片段时非常够用。第三结果直观电泳峰图可以直接人工判读一个双峰可能就是杂合突变不需要复杂的生物信息学分析这让它在普通分子实验室里“零门槛”可用。但它的短板同样明显。首先通量低一台96道毛细管电泳仪一次最多跑96个反应对需要大规模筛查的场景完全不够看。其次成本高是相对的——如果是单个片段验证Sanger可能反而便宜但如果按每个碱基或每个样本的测序成本折算一代远高于二代。第三它对混合模板几乎没有分辨能力样品里如果混有两种以上模板比如复杂微生物群落Sanger会直接测出乱七八糟的叠加峰结果没法解读。最后它需要高质量的PCR产物或克隆如果目标区域有高GC或复杂二级结构扩增本身就是一道坎。2.3 今天还在用一代测序的场景很多人以为Sanger已经被时代淘汰了但实际只要你接触过临床检验、分子克隆、微生物鉴定就会知道它依然是“日常主力”。单基因突变验证二代panel筛查出的候选位点用Sanger复核是遗传病诊断的常规流程。质粒构建验证克隆PCR产物、点突变体、重组质粒酶切后跑胶确认没问题再拿菌液或质粒去Sanger测序读回插入片段序列确认没有碱基错误或移码。病原体种属鉴定16S rRNA、ITS等标记基因的Sanger测序一直是细菌或真菌鉴定的常见方式因为一条读长基本能覆盖目标区段的大部分信息。基因分型HLA低分辨分型、某些药物代谢基因位点检测仍然有不少实验室在用Sanger。我个人的一个体会是如果是几十个样本、每个样本只需要测1到2条片段的小项目Sanger的时效性和性价比反而能超过二代。因为二代建库、上机、生信分析一套走下来最少也要两三天而Sanger当天就能出峰图。不要因为它“老”就觉得它没用。3. 二代测序把通量和成本打下来的绝对主力3.1 二代测序的“并行化魔法”到底是什么二代测序和一代最本质的区别就是它把所有DNA片段都固定在芯片上让它们同时进行测序反应再通过显微成像系统记录海量反应点的碱基信号。以Illumina平台为例它的流程大致是先把基因组DNA打成几百个碱基的小片段加上接头做成文库然后文库片段通过桥式PCR在芯片表面扩增形成一个个包含成千上万条相同序列的“DNA簇”接下来进入边合成边测序SBS环节每个循环加入带有可逆荧光标记的碱基DNA聚合酶每延伸一个碱基激光激发荧光、相机拍照记录每个簇这个位置上的碱基颜色最后切掉荧光标记进入下一个循环如此往复。这里面有一个经常被低估的设计把每条DNA片段扩增成一个cluster本质上是为了“信号放大”——单个分子的荧光信号太弱相机拍不清楚但一个cluster里所有分子同步延伸信号强度就足够可靠了。这也带来了一个问题PCR扩增本身会引入一定偏差和错误某些序列比如高GC区或重复区扩增效率差就会形成覆盖盲区。换个角度来看二代的“准”是建立在“同一个簇里大量相同序列互相投票”的基础上的所以在簇内是共识结果而不是真正的单分子测序。3.2 二代测序的优缺点一条条说清楚二代测序的优势非常明显。第一通量极高一台最新的NovaSeq X系列单次运行可以产出几个Tb太碱基的数据这意味着一次能把几十甚至上百个人类样本的全基因组都测完。第二单碱基成本低如果把人类全基因组30x深度的测序成本算下来已经降到几千甚至数百元人民币的量级这是其他平台无法比拟的。第三分析生态成熟从比对软件BWA到变异检测工具GATK从RNA-seq定量的STAR/featureCounts到各种分型工具整个工具链非常完善社区资料也海量遇到问题很容易找到答案。第四定量准确测序深度和转录丰度之间的关系相对明确适合表达量分析和拷贝数变异评估。但它的短板也集中在这几个方向。第一读长短常规PE150也就是双向各150个碱基在拼接基因组时遇到重复序列和高GC区域经常会“断链”或错拼。第二存在PCR偏好性文库扩增过程中高GC或低GC区域容易被放大或丢失导致覆盖不均。第三对于结构变异不友好大片段插入、缺失、倒位、重复扩增这类变异短读长很难精确判断断点和拷贝状态。第四无法直接读取碱基修饰信息比如甲基化需要额外的转化处理或免疫共沉淀步骤。3.3 二代测序的典型应用场景二代测序是当前科研和临床的主流工具几乎覆盖了组学研究的方方面面。全基因组测序WGS人类、动植物、微生物的基因组测序和突变异检测30x到100x深度不等。全外显子组测序WES和靶向panel遗传病筛查、肿瘤用药相关基因panel这类场景对成本敏感二代是最合适选择。转录组测序RNA-seq基因表达定量、差异表达分析、可变剪接的初步评估。表观组学全基因组甲基化测序WGBS、ChIP-seq、ATAC-seq等。扩增子测序16S/ITS微生物多样性分析、特定区域超深度测序。单细胞测序10X Genomics平台建库后核心测序读长就是二代。做肿瘤panel的时候我最直观的感受就是如果只是找点突变二代测个几百上千乘深度都行但如果想确认一个大片段缺失的具体断点二代通常只能给一个“拷贝数下降”的提示最终还得拿三代长读长去把这个断裂位置彻底看清。4. 三代测序为“读长”而生的颠覆者4.1 两条主流技术路线PacBio SMRT与Nanopore如果我们把二代测序类比成把一本厚书全部撕成小纸条每张纸条只读几个字再靠重叠信息拼回原书那三代测序就是直接拿扫描仪一行一行把整页完整扫下来甚至直接整本书连续翻页读。三代测序目前有两条主流技术路线原理完全不同但目标一致——读长更长、单分子测序。PacBio的SMRTSingle Molecule Real-Time测序基于零模波导孔技术。DNA聚合酶被固定在纳米级小孔底部一条DNA模板在酶的作用下延伸每掺入一个荧光标记核苷酸激光激发产生信号相机实时记录。因为是单分子实时成像不需要像二代那样先做PCR扩增。PacBio目前的两种测序模式里传统连续长读长CLR模式读长很长但单pass准确率偏低而CCS/HiFi模式把一个环状文库反复滚环扩增让同一个分子被读取多次再通过一致性算法得到高准确率的长读长通常单分子准确率能到99.9%以上相当于用“时间换准确率”。Oxford Nanopore技术则完全是另一套思路。它让单链DNA穿过一个蛋白纳米孔不同碱基经过孔时会引起不同的电流变化通过检测电流扰动实时判读碱基序列。最突出的是MinION系列设备体积非常小可以外带到野外或临床现场数据实时产出几分钟内开始出读长而且超长读长是它的招牌。4.2 三代测序的真正优势和绕不开的问题先说核心优势。第一读长极长PacBio的HiFi模式通常能到15到25kbONT更是常见10kb以上甚至有几十万到上百万碱基的记录。读长直接决定跨过重复序列和结构变异的能力长读长能把“重复片段之间的完整上下文”读出来。第二无PCR扩增避免了扩增偏好性GC偏差问题小很多测序信号和原始DNA组成更接近。第三直接检测碱基修饰PacBio可以通过动力学信号检测甲基化ONT能直接分析电流信号差异来识别修饰碱基不需要额外建库转化。第四实时性尤其Nanopore让人能边测序边分析病原体快检场景特别香。但它的问题也很明显。首先是单碱基准确率传统长读长模式下尤其ONT早期版本准确率只有85%到95%虽然HiFi模式提升了单分子准确率但它本质上是用更高的测序深度换来的成本会明显增加。其次是单Gb成本仍然远高于二代做大规模重测序时如果样本量上千用三代测不仅预算撑不住数据分析的计算压力也会大很多。第三是通量天花板相比二代每次运行几个Tb的数据产出三代平台通量相对有限需要多台设备并行或长期运行才能追赶。第四是部分平台尤其Nanopore存在均聚物错误homopolymer即连续相同碱基的读数容易出错但要处理这类问题通常需要后期算法辅助修正。4.3 最适合三代测序的场景三代测序不是来“取代二代”的它在几个二代特别吃力的领域里表现突出。基因组从头组装de novo assembly无论动植物复杂基因组还是细菌基因组长读长都是提升组装连续性最直接的手段配合HiFi数据染色体级别的组装已经成为可能。结构变异检测复杂肿瘤基因组或罕见遗传病里的大片段插入缺失、倒位、串联重复扩增用三代能精确读出断点序列。全长转录组测序Iso-seq直接测完整转录本精确区分异构体不用像RNA-seq那样靠后续组装猜剪接方式。复杂区域测序端粒、着丝粒、高度重复序列区域以前拼不出来三代拿着长读长一个一个跨。病原体快速鉴定Nanopore的便携和实时特性让它特别适合医院感染暴发、疑难样本快检、野外监测等场景。直接甲基化检测想同时拿到序列和甲基化信息又不想做亚硫酸氢盐转化三代是天然适配。5. 一张表看懂三代测序的核心参数对比5.1 核心参数对比表为方便查阅我把日常交流中最常用的参数放到一张表里。你可以根据自己的研究目的快速对号入座。对比维度一代测序Sanger二代测序NGS三代测序PacBio/ONT测序原理双脱氧终止毛细管电泳边合成边测序簇扩增荧光成像单分子实时测序PacBio或纳米孔电流检测ONT读长600-1000 bp50-300 bp常规PE150平均10-100 kb最长可达Mb级单碱基准确率极高99.999%高99.9%深度覆盖后Q30以上传统长读长85%-95%HiFi模式可到99.9%以上通量低每次96/384反应极高单次可达数Tb中等具体看平台和运行时间单Gb成本极高很低仍然偏高建库时间短数小时1-2天数小时至1天PCR扩增需要需要桥式/乳液PCR基本不需要主要优点准确、直观、便宜小规模高通量、成本低、生态成熟长读长、无PCR偏好、可直接检测修饰主要局限通量低、成本高大规模读长短、重复区和SV检测弱单分子准确率较低传统模式、成本较高、通量有限代表平台ABI 3730xl等Illumina NovaSeq、MGI DNBSEQ等PacBio Sequel/Revio、ONT MinION/PromethION等需要强调一下表里标注的数值是常规状态具体平台和试剂版本之间会有明显差异。比如ONT近几年准确率提升很快新推出的试剂和算法让“原始准确率低”这个标签逐渐淡化但均聚物错误等问题仍需要关注。5.2 参数背后的选型逻辑选平台不能只盯着某一个参数要结合项目目的算总账。读长决定的是“能解决什么复杂度的问题”。如果你只关心点突变150bp的读长完全足够如果你想组装一个高重复的植物基因组没有20kb以上的长读长后面每一步拼接都是在“硬拼”费时费力还容易出错。通量决定“一次能跑多少样本”大规模人群筛查基因突变肯定用二代更划算但如果你只有一两个细菌基因组需要组装三代单样本跑一次可能比“先攒几十个样本再跑二代”更快。成本要按“项目总成本”算而不是只算测序本身的每Gb单价。比如一个基因组组装项目用二代可能需要“多轮补测很多生信调试”才能拼完而三代可能一两轮就结束总成本反而是二代方案更高。准确率也要看“原始准确率”“一致性准确率”两个层次。二代cluster测序本质上是很多分子的平均单簇准确率很高三代单分子直接测单pass准确率确实可能不如二代但HiFi模式把同一个分子读很多遍后取一致准确率就上来了。这意味着终结果质量不仅取决于平台还要看实验设计和数据分析策略。6. 实战中的平台选型不同项目到底怎么选6.1 六类常见场景的测序方案建议纸上谈兵没意思我直接把做过的、见到的几类典型场景整理成建议供你参考。项目类型推荐方案核心理由单个位点突变验证一代Sanger准确率最高出结果快成本低人群全基因组或外显子测序二代WGS/WES通量大、单样本成本低、分析链路成熟某个致病基因panel筛查二代靶向测序一次覆盖几十上百个基因灵敏度高全新基因组组装三代HiFi二代polish长读长跨重复区二代短读长纠错碱基级错误肿瘤结构变异精细解析三代长读长精确覆盖融合断点、大片段缺失感染性病原体快速鉴定三代Nanopore设备便携、实时出结果适合临床快速决策转录本异构体精确分析三代Iso-seq完整全长转录本不用组装异构体宏基因组定量分型二代三代组合二代高通量定量三代补充长片段分型信息从这个表也能看出来很多项目其实不会只选一种平台而是两者甚至三者配合使用。6.2 混合测序方案组合拳才是最优解我越来越觉得“二选一”是新手很容易掉进去的坑有经验的团队往往会做“组合策略”。最经典的组合是“三代组装二代纠错”。三代长读长先把基因组骨架拼起来再用二代短读长做polish修正三代数据里可能存在的碱基级错误最终得到高质量参考基因组。现在很多高水平基因组项目就是这么干的两者配合能达到单平台达不到的质量。另一个常见组合是“二代大范围筛查三代定点精细解析”。比如做家族性遗传病研究先用二代panel或WES把候选基因筛出来如果怀疑致病变异是结构变异就针对该区域用三代长读长做靶向测序精确定位断裂点和突变模式。这比一上来就对所有样本跑三代便宜得多也高效得多。还有宏基因组领域用Nanopore长读长做快速物种初筛和抗性基因判断同时用二代做深度定量和微生物组成解析。两条线的数据互相验证比单平台拿到的信息面完整很多。我在实际项目里最大的感受是不要被“测序平台新老之争”影响真正的核心指标只有一个就是“能否在预算和时间内解决科学问题”。组合方案听起来多花钱但常常是省钱的。7. 常见问题与避坑指南7.1 几个容易绕进去的认知误区误区一三代测序一定比二代好。这个前面已经反复强调了。三代在长读长场景下确实有不可替代的优势但在点突变筛查和大队列研究中成本和时间完全不占优。不要因为“技术先进”就盲目选三代。误区二三代测序准确率一定低。如果你用的是PacBio HiFi模式单分子准确率已经接近甚至超过99.9%很多场景下比二代短读长更有说服力。ONT准确率也在逐年提升。不能一概而论要看具体的测序模式和深度。误区三一代已经过时。临床突变验证、质粒确认、种属鉴定等场景一代依旧是高效方式。尤其是面对少量样本时Sanger当天出结果的优势非常明显。误区四测序深度越深越好。深度过高不仅成本浪费还可能带来一定系统噪声。一般人类WGS 30x左右就足够外显子组通常80x到100x具体还是要根据项目和应用场景来定。7.2 实操中值得注意的几个细节建库环节最容易翻车。不管用哪种平台DNA质量都是决定性因素。二代对DNA总量和完整性有要求但近年低起始量建库试剂盒正在降低门槛三代长读长对高分子量DNA的要求更严格提取过程中如果打断过度后续读长会明显缩水。做Nanopore时提取新鲜样本更稳妥老样本的降解风险很高。数据质控不能只看Q30。二代要检查插入片段大小、比对率、重复率、覆盖均匀度三代则要看读长N50、单读碱基准确率、是否有接头污染。现在很多分析流程会自动过滤低质量reads但我也遇到过拿到的原始数据有一大截接头序列没切干净的情况如果忽略后续比对和变异检测都会受到干扰。三代数据分析要转换思路。不要想当然拿BWA去比对三代长读长通常用minimap2这类长读长比对工具。基因组组装也一样二代组装常用SPAdes三代更常听到的是Flye、Hifiasm、Canu等工具栈不同趋势和参数也不一样。很多做惯了二代的人第一次跑三代数据会发现自己熟悉的软件全部不适用这是正常现象。最后再分享一个我踩过的坑做基因组组装之前务必先搞清楚样本的倍性、杂合度和基因组大小。高杂合样本直接用三代HiFi组装如果不做杂合性控制组装结果里可能出现大量“双倍路径”或分型混乱后续注释和下游分析都会很痛苦。说到底测序平台只是工具没有绝对的“最好”只有“最适合”。根据样本数量、基因组复杂度、预算和分析能力综合判断才是成熟的研究者该做的事。如果你刚开始接触某个类型的项目先从现有文献和公共数据库里看看同类研究用了什么策略通常能少走很多弯路。
返回列表