
两年多前我处理一批胶质母细胞瘤的全基因组数据遇到一例很反常的样本EGFR位点的覆盖深度高得离谱常规扩增分析却怎么都拼不回一条线性染色体上。后来我把那些断头读段的连接关系摊开才意识到高拷贝片段并不是散落在基因组不同位置而是首尾相接成环、游离在染色体之外——这就是染色体外环状DNA。这几年这个名词在肿瘤研究里升温非常快已经从一个偏冷门的细胞遗传学观察变成公认的肿瘤基因组新阵地。无论你是做肿瘤机制、生信分析、病理诊断还是找治疗靶点都应该花点时间把它彻底搞明白。这篇文章我会按我自己的实践理解把几个核心问题讲清楚它到底是什么为什么在肿瘤里如此能折腾怎么在实验和测序数据里把它找出来以及眼下有哪些临床转化窗口。1. 先说清楚eccDNA、microDNA 和肿瘤里的 ecDNA 并不是同一个东西很多刚接触这个方向的人第一道坎不是技术而是概念。中文文献里“染色体外环状DNA”经常被直接翻译成eccDNA但eccDNA其实是个很大的筐里面装着好几类性质完全不同的分子。如果不先把边界划清楚后面读文献、搭算法、设计实验都很容易跑偏。1.1 三种经常被混为一谈的环状DNA我习惯把目前文献里常见的环状DNA分成三类它们的生物起源、片段大小、功能意义都不一样。第一类叫microDNA通常只有几百个碱基到几千个碱基不含完整基因来源很随机很多是从基因密集区域“剪”下来的小环。这类分子在正常细胞和肿瘤细胞里都存在目前科学界对它的功能还没有统一结论。有的研究认为它可能与嵌合RNA生成有关也可能只是DNA复制或修复过程中的副产物。第二类是广义的eccDNA可以看作所有染色体外环状DNA的总称大小可以从几百碱基到几百万碱基不等。老一辈研究人员在电镜下看到的“small polydispersed circular DNA”也属于这个范畴。这类分子虽然名字带着“环”但绝大多数不携带驱动癌基因在肿瘤发生里的作用仍有争议。第三类是真正让肿瘤研究圈兴奋的癌性ecDNA也叫oncogenic ecDNA。它通常很大几百kb到数Mb携带完整的癌基因和调控元件比如EGFR、MYC、MYCN、ERBB2、MDM2等。它不含着丝粒和端粒所以有丝分裂时不会被均等分配拷贝数在子代细胞里可以剧烈波动。存在这类ecDNA的肿瘤往往异质性更高耐药能力更强。类型典型大小形态与来源在肿瘤研究中的角色microDNA几百bp~几千bp小环状基因密集区剪接而来功能仍不明确可能参与嵌合RNA生成广义eccDNA数百bp~数Mb所有染色体外环状DNA总称大部分是副产物部分可能是调控信号癌性ecDNA数百kb~数Mb大环状携带癌基因与调控元件驱动癌基因扩增、瘤内异质性和耐药放在一起看就明白了如果一篇文章说的是“肿瘤样本里检测到大量eccDNA”它可能只是在描述很多小环但如果说的是“肿瘤依赖ecDNA维持癌基因高表达”那基本是在描述第三类大分子。中文语境下这两者经常被混着用读文献时一定要先看方法学部分到底检测的是哪个尺寸范围的环。1.2 从双微体到ecDNA的认知跃迁其实染色体外环状DNA并不是新发现。上世纪五六十年代细胞遗传学家就曾在儿童肿瘤细胞里观察到一种奇怪的结构两条小小的染色体样颗粒并排出现因为形态像是多出来的微小染色体所以取名叫双微体double minutes。在很长一段时间里双微体只是细胞遗传学的一个观察现象大家默认它是基因扩增的产物但并没有认为它值得被单独研究。真正的认知转变发生在2010年代中后期。随着全基因组测序、长读长测序和染色质构象捕获技术成熟研究人员发现双微体在分子层面就是一类大环状ecDNA而且它们不只是简单的高拷贝重复而是带有完整启动子、增强子、绝缘子等调控元件的功能单元。2019年前后几篇关键研究把ecDNA推到了聚光灯下一项覆盖三千多例肿瘤样本的泛癌分析显示超过三分之一的肿瘤可检出ecDNA在胶质母细胞瘤、神经母细胞瘤、乳腺癌、食管癌、肺癌等癌种中比例更高同时ecDNA的存在与患者预后更差显著相关。换句话说过去半个世纪肿瘤细胞遗传学里那个不起眼的“双微体”今天被重新理解为驱动肿瘤演化的一类重要基因组载体。这个认知升级带来的是整个研究范式的变化。2. 肿瘤为什么选择环状形成机制与三个“生存优势”如果你问一个做进化生物学的人为什么肿瘤特别偏爱染色体外环状结构答案其实很直接因为环状基因组给肿瘤提供了线性基因组难以获得的灵活性和高表达效率。2.1 主流的形成假说chromothripsis不是唯一入口关于ecDNA是怎么来的目前还没有一个统一模型但几个假说基本得到了主流认可。最常见的机制是染色体碎裂chromothripsis。一条染色体在某个事件中被打成几十甚至上百个片段本该由DNA修复系统重新拼回去但如果这些片段在修复过程中选了错误的方向连接就可能形成环状分子。如果环里恰好包括一个强启动子和一个癌基因这个环就获得了竞争优势随着细胞分裂不断扩增最终成为肿瘤基因组里最显眼的结构。另一条重要路径是断裂-融合-桥breakage-fusion-bridge, BFB循环。染色体末端端粒丢失后两个断裂的染色体末端会发生融合形成双着丝粒染色体。在有丝分裂时这个异常的染色体被拉向两极形成“桥”桥再次断裂后会产生新的重排其中一部分可能被环化。BFB循环在多种肿瘤里都能检测到特征性拷贝数模式和ecDNA形成密切相关。还有一类是附加体切除模型。基因组里的重复序列、转座子等区域在DNA复制或修复时可能被切除形成小环再通过多次重组逐渐变大最终变成携带癌基因的大环。这个过程可能在正常细胞里也在发生但只有那些给细胞带来生长优势的环才会被正向选择保留下来。说白了ecDNA的形成本身可能是随机错误但携带癌基因、能提高细胞适应度的那些环会被肿瘤像“抽卡”一样留下来。2.2 环状结构给肿瘤带来的三个“超能力”理解了形成机制还得明白为什么肿瘤一旦拿到ecDNA就相当于拿到了“外挂”。我总结了三个核心优势。第一个是拷贝数快速演化。线性染色体上的基因扩增通常是串联重复拷贝数变化幅度有限而且需要经过较长世代的累积。但ecDNA不含着丝粒在有丝分裂时没有定向分配机制子细胞里拿到的ecDNA数量可以忽多忽少。也就是说一个细胞从携带10个拷贝变成携带100个拷贝可能只需要几代分裂。当治疗压力出现时肿瘤可以通过迅速调整ecDNA拷贝数来适应环境。第二个是超强的转录活性。多项表观基因组研究表明ecDNA上的染色质比线性基因组区域更开放ATAC-seq信号明显更高说明它有更多活跃的调控元件被暴露出来。开放染色质带来的结果就是癌基因表达水平被推得非常高。同样是EGFR扩增如果基因以线性串联形式存在表达水平是一回事如果以ecDNA环状形式存在表达水平可以高出一个数量级而且更容易被增强子激活。第三个是“多基因打包”能力。一条线性染色体上相隔很远的基因不容易被同时高表达但ecDNA可以把一个癌基因和它所需的增强子、其他共扩增基因打包在同一个环上形成一个小型“表达模块”。这解释了为什么在许多肿瘤里几个关键基因会以非常高的频率同时扩增——它们可能就在同一个ecDNA环上被一起带动了。2.3 表观层面增强子风暴和ecDNA hubs除了拷贝数和转录活性ecDNA还有一层更微妙的优势它在细胞核里不是散乱漂浮的而是倾向于聚集成一个个“聚集点”术语叫ecDNA hubs。这个现象很像增强子“扎堆开会”。在正常基因组里增强子和启动子通过染色质环化机制靠近协同调控基因表达。ecDNA因为有大量开放染色质和增强子序列多个环状DNA会在细胞核里物理靠近形成高密度的转录中心。结果就是癌基因获得了远超线性扩增的转录资源细胞里仿佛刮起一场增强子风暴。对于药物研发来说这点特别重要。因为ecDNA上的基因表达依赖这些聚集增强子和表观调节因子那么靶向表观遗传调控的药物——比如BET抑制剂、CDK7抑制剂——就可能对ecDNA阳性的肿瘤有偏好性杀伤作用。后面讲治疗时会再展开。3. 抓环的完整链路从细胞到序列从序列到结构很多实验室卡在同一个地方知道ecDNA重要但不知道该怎么可靠地检测和定量。这里没有一劳永逸的单一方案最稳妥的策略是湿实验和干实验交叉验证。3.1 显微镜下看到的环FISH和超分辨最直接证明ecDNA存在的方法是荧光原位杂交FISH。针对已知的扩增基因比如EGFR或MYC设计DNA探针在间期细胞核上做杂交。如果基因扩增在线性染色体上你会看到信号集中在染色体的特定位置如果存在ecDNA信号会呈多个分散的小点散布在细胞核各处。这个判断看似简单实际操作有几个细节。一是探针质量必须稳定商业探针或自标记BAC探针都需要做对照验证二是DAPI染色和探针信号要同时采集避免把染色体近旁的信号误判成染色体外信号三是最好用z轴层扫因为ecDNA小点在二维图像里很容易被漏掉。超分辨显微镜能提供更清晰的环形结构证据但通量低适合做机制研究不适合做常规筛查。3.2 短读长WGS和结构预测算法从覆盖峰到环状路径如果要筛查全基因组范围内是否存在ecDNA目前的主流抓手还是全基因组测序WGS深度至少30x最好做到60x。全外显子测序WES虽然能看到拷贝数异常但缺乏足够的断点信息无法可靠地区分ecDNA和线性串联扩增。我的常规分析链路是原始数据质控去除接头和低质量碱基用BWA-MEM比对到参考基因组标记重复做拷贝数分析找出高倍扩增区域提取比对文件里的不一致读段和soft-clipped读段识别结构变异断点把高拷贝区域和断点信息放到AmpliconArchitectAA这类算法里构建扩增子结构模型用AmpliconClassifier等分类器判断结构类型区分ecDNA、双微体、BFB和线性串联扩增。流程里最关键也是最容易出错的一步在第5步。AA不是简单地把高拷贝区域圈出来它会把覆盖度信号和断点连接组合成一张图然后寻找能解释所有数据的路径如果路径首尾相接就会输出环形结构。这个算法依赖高质量的比对结果低质量的FFPE测序数据会让断点噪声急剧上升得到很多假阳性环状结构。实际的bash处理中比对这一步和常规WGS分析没有区别bwa mem -M -t 16 reference.fa sample_R1.fastq.gz sample_R2.fastq.gz sample.sam samtools view -bS sample.sam sample.bam samtools sort - 16 sample.bam -o sample.sorted.bam samtools index sample.sorted.bam比对完成后记得用Picard或GATK做MarkDuplicates再进入后续的拷贝数和断点分析。AA官方仓库有完整的预处理脚本具体命令以当时版本为准但输入格式基本就是排序去重后的BAM文件。3.3 长读长与Circle-Seq的互补价值短读长WGS可以发现ecDNA存在的迹象但它很难把复杂的环状结构从头到尾组装出来。如果某个ecDNA携带了大量重复序列或结构高度复杂短读长数据往往拼出“疑似的环”却看不见完整的“真实形状”。长读长测序比如PacBio HiFi和纳米孔超长测序可以在单个读段内跨越更长的片段把断点连接处的几百bp变成几十kb的连续证据显著提升ecDNA结构重建的准确性。缺点依然是成本和DNA起始量要求高对临床样本尤其不友好。如果研究对象是microDNA或小分子eccDNACircle-Seq是更合适的路线。它的原理是先提取细胞或血浆中的DNA用专门的线性DNA外切酶把线性DNA消化掉只留下环状分子再用滚环扩增RCA放大信号最后做测序。这套方法灵敏度和特异性都不错但它的富集窗口偏向几百bp到几十kb的小环对几百kb的大ecDNA并不适配。所以选择技术路线前先问自己一句我想找的到底是哪种环如果是与癌基因扩增相关的大ecDNAWGSFISH是主线如果是探索小环分子标志物Circle-Seq更合适。3.4 样本处理和比对质控的常见坑这个方向最隐蔽的坑往往不在分析里而在样本处理阶段。首先是FFPE样本问题。石蜡包埋组织里DNA交联严重、片段化明显很多小ecDNA在提取过程中就断了。做回顾性临床队列分析时如果样本来源是FFPE检出的ecDNA频率会被系统性低估。能用新鲜冷冻样本就尽量用新鲜冷冻样本如果必须用FFPE要把提取方法改成更温和的方案并且用多个技术平台交叉验证。其次是环状DNA在常规提取中的“隐形丢失”。很多商业化DNA提取柱对小片段DNA回收率较低Circle-Seq所用的外切酶消化步骤也容易把部分大环非特异降解。我建议在提取后用Agilent片段分析仪看一下DNA片段分布如果小片段比例异常低就要警惕环状DNA丢失。第三是分析中的GC偏好和比对假象。高拷贝区域通常伴随覆盖度极度不均如果比对质量不高soft-clipped读段会产生大量虚假断点。我的习惯是同时在两个参考基因组版本上跑一遍结果一致才下结论。最后强调一句生信预测的ecDNA必须在湿实验里得到FISH或至少PCR验证。只靠算法输出就直接写“该肿瘤存在ecDNA”在审稿阶段很难站住脚。这也是我踩过最大的一次坑下节详细说。4. 从实验室到病床耐药、液体活检和靶向干预ecDNA研究的转化价值最终要落在临床问题上。目前最受关注的三个方向分别是耐药机制、液体活检和治疗策略。4.1 耐药不是简单的拷贝数升降而是结构演化很多靶向药物的耐药机制最后都指向同一个结论肿瘤在治疗压力下会把原本有限的ecDNA拷贝数快速扩增或者产生携带突变的新ecDNA让对应的耐药克隆活下来。比如EGFR突变型非小细胞肺癌一代三代EGFR-TKI的耐药机制里除了常见二次突变还有一个重要原因是EGFR通过ecDNA形式高倍扩增使药物浓度不足以完全抑制残余信号。BRAF抑制剂耐药中也观察到类似现象肿瘤细胞通过动态调整ecDNA上的BRAF拷贝数来“试探”最佳耐药剂量。这种动态调整能力是线性扩增难以企及的。线性串联重复虽然也可以增加拷贝数但增减需要经历大规模同源重组速度慢、代价高。而ecDNA因为随机分配群体里永远存在拷贝数不同的亚克隆一旦药物压力出现高拷贝克隆会被快速筛出来。所以在研究耐药时只看静态拷贝数远远不够还要看扩增子的结构是否以环状形式存在、是否有变化空间。4.2 血浆中的环状DNA一个还在早期阶段的检测窗口肿瘤细胞凋亡、坏死或主动释放时细胞里的DNA会进入外周血形成循环肿瘤DNActDNA。传统ctDNA检测主要捕捉线性DNA片段但如果肿瘤细胞里存在大量ecDNA这些环状分子同样可能进入血浆。已经有研究在肿瘤患者血浆中检测到肿瘤来源的环状DNA并且发现它们的序列组成与肿瘤组织里的ecDNA一致。这意味着液体活检可能是未来追踪ecDNA演化的重要窗口。相比组织穿刺血浆检测可以反复取样能连续监测治疗过程中ecDNA拷贝数和结构的变化理论上可以实现耐药预警。但必须承认这个方向还远未标准化。环状DNA在血浆里的浓度低、半衰期未知、富集方法不统一目前没有成熟的临床检测产品。我做过的几个探索性项目里血浆小环DNA的批次效应很明显实验流程差一个小步骤结果可能天差地别。如果你打算做这个方向一定要先固定好采血管、保存时间、提取试剂和分析流程再谈队列发现。4.3 针对ecDNA的干预直接切、诱导丢失、靶向表观治疗层面的进展目前主要分为几条路线。一是直接靶向ecDNA分子本身。CRISPR-Cas9可以设计导向RNA在ecDNA的特异序列上制造双链断裂让环状分子线性化。因为ecDNA不含着丝粒线性化后的片段会在细胞分裂中逐渐丢失从而降低癌基因拷贝数。这个策略在细胞和小鼠模型里已有概念验证但要走到临床还面临递送效率、脱靶、耐药等大量问题。二是利用ecDNA对表观遗传抑制剂的脆弱性。前面提到ecDNA上有大量开放染色质和增强子转录高度依赖BET蛋白、CDK7等表观调节因子。因此BET抑制剂、CDK7抑制剂在ecDNA阳性肿瘤中表现出更明显的杀伤效果。这类药物不是直接清除ecDNA而是关闭ecDNA上的超强转录机器让肿瘤细胞“带环死掉”。三是利用复制应激和DNA损伤反应。ecDNA的高拷贝扩增意味着它需要大量复制起始这会给肿瘤细胞带来额外的复制压力。PARP抑制剂、ATR抑制剂、CHK1抑制剂等药物可能通过打击这些复制压力机制选择性地杀伤ecDNA阳性细胞。目前这些还属于临床前和早期临床探索但逻辑上非常自洽。四是和天然免疫结合。当细胞质里出现异常环状DNA时cGAS-STING通路会被激活引发先天免疫反应。理论上说肿瘤细胞如果大量产生eccDNA并泄漏到细胞质中应该更容易被免疫系统识别。但肿瘤通常存在多种逃逸机制会主动抑制这条通路。如果能找到方法让ecDNA诱导的天然免疫信号重新释放也许能提高免疫治疗的应答率。5. 我眼中最值得深挖的方向以及给新入场者的几句实话每次讲完ecDNA的现状总有人问我同一个问题既然方向这么好到底还有哪些空白可以切入这里我梳理一下我理解中几个卡了多年的核心问题以及如果现在组队进入这个方向我会怎么做。5.1 几个卡了很久的科学问题第一个问题是ecDNA在不同癌种里的“普遍性”到底有多大。泛癌数据显示超过三分之一的肿瘤存在ecDNA但不同研究之间的检出率差异很大。原因可能是技术平台不同也可能是样本处理和算法差异。至今没有一个大样本、多中心、统一流程的ecDNA流行病学调查。第二个问题是正常细胞里的eccDNA是如何一步步演变成携带癌基因的大ecDNA的。目前多数研究集中在已形成的ecDNA上但从小环到大环的“过渡形态”很少被系统追踪。搞清楚这个演化过程有可能找到干预ecDNA形成的上游靶点。第三个问题是ecDNA拷贝数的动态变化由什么调控。细胞如何决定是保留更多ecDNA还是丢掉它这背后可能存在一套我们还没理解的调控机制也许和DNA复制时机、染色体分离错误、DNA损伤修复状态都有关。如果找到这种调控的开关就可能人为降低ecDNA的稳定性让肿瘤自己丢掉癌基因。第四个问题是如何在临床应用里建立“ecDNA检测”的标准化。现在做FISH、WGS、Circle-Seq的实验室各自有自己的标准和判读规则结果的一致性难以保证。想要进入临床分层或伴随诊断必须有统一的报告框架、阳性阈值和验证流程。5.2 如果我现在进入这个方向会怎么安排优先级先说一句可能让很多人意外的话不要一开始就上大队列、全基因组、高成本生信分析。我见过不止一个团队在公共数据里跑出一堆“预测ecDNA”的扩增子最后因为缺乏湿实验验证整个故事推倒重来。如果让我重新排优先级会是这样第一先选定一个明确携带已知扩增子的肿瘤类型和细胞系模型比如EGFR扩增的胶质母细胞瘤、MYCN扩增的神经母细胞瘤。用DNA FISH在几种候选细胞系里做预筛确认哪一个在体外稳定携带ecDNA。第二用WGS30x以上和AmpliconArchitect把细胞系的ecDNA结构解析清楚建立一套“FISH WGS 结构分类”的标准流程。这套流程以后所有项目都要复用先跑通它比急着出结果更值钱。第三用公共WGS数据比如PCAWG等开放数据集做泛癌筛查把算法跑出来的候选ecDNA都汇总起来形成自己的数据库。公共数据的好处是可以无限次重复分析不用花一分钱实验经费适合团队早期积累分析经验。第四找到一两个具体的生物学问题比如ecDNA在某一类耐药模型里的动态变化设计纵向实验。这个阶段再决定要不要上长读长测序、单细胞测序或表观组学。第五如果目标是临床转化从一开始就要收集新鲜冷冻肿瘤组织和配对血浆处理好伦理和存储确保后续能做液体活检探索。总的来说染色体外环状DNA这个方向的“风口”属性很明显但真正能留下价值的工作仍然是那些把机制讲清楚、把检测做扎实、把临床问题对齐的研究。技术本身会迭代但“结构预测必须验证”这条底线会一直适用。