
没做过 转录因子结合位点分析的人大概很难理解这玩意儿到底有多折腾。早几年我想查一个转录因子到底调控哪些靶基因要么去翻文献一篇篇找实验证据要么拿JASPAR做序列motif预测出来一堆候选位点再交叉比对启动子区域一次分析能磨掉一整天最后还不一定有结论。后来接触到ChIP-Atlas才算是把这条路真正走通了——它把公共数据库里海量的ChIP-seq数据整合在一起你只要输入一个转录因子的名字就能直接看到它在全基因组上的结合位点、候选靶基因和信号富集情况。今年ChIP-Atlas更新到3.0版本之后数据量和分析功能都有了明显提升这篇就把我从2.0用到3.0的真实体验、操作细节和踩过的坑全部整理出来。ChIP-Atlas这个东西你可以把它理解成一个公共ChIP-seq数据的大型搜索引擎。它把全世界实验室提交到NCBI SRA、DDBJ、ArrayExpress等公共数据库里的原始ChIP-seq数据全部下载、比对、统一处理再用一致的流程call peak最后做成一个可以自由查询和可视化的数据库。目前3.0版本整合的公共数据已经覆盖了超过10万个样本涉及人类、小鼠、大鼠、果蝇、斑马鱼、线虫等多个物种转录因子、组蛋白修饰、染色质重塑因子等各类因子都在范围内。不管你是做干实验还是湿实验只要涉及某个因子结合在哪些基因附近某个基因受到哪些因子调控某个因子的结合信号在特定条件下有什么变化这类问题它基本都能给你一个相对可靠的答案。这篇内容主要写给两类人。一类是做转录调控研究但还没用过ChIP-Atlas的人可以把它当成一份快速上手手册另一类是用过旧版本、但对3.0的新功能还不太熟悉的人重点看看新增的信号比较分析和差异结合分析该怎么用。文章不会讲太深的理论重心放在实际操作具体访问哪个入口、参数怎么设置、结果怎么看、怎么跟JASPAR这类预测工具做互补验证。1. 为什么说找结合位点这件事以前这么难先说个背景。研究转录因子TF调控机制最核心的问题就是搞清楚它在基因组上的哪些地方结合、结合之后影响了哪些基因的表达。过去要回答这个问题主要有两条路但两条路都有明显的局限性。一条路是用JASPAR这类基于序列特征的预测工具。JASPAR维护着一个转录因子结合motif的数据库每一个转录因子都有一组已知的DNA序列偏好性。你把某个基因的启动子区域提取出来用FIMO或者MEME Suite去扫描就能找到潜在的结合位点。这个方法的好处是快几秒钟出结果对完全没有实验数据的转录因子尤其宝贵。但问题是motif预测的本质是序列相似性匹配它在基因组上打出来的分数往往事与愿违——一个启动子区域动不动就几百上千个候选位点高分位点一大堆到底哪几个是真实结合的根本没法定论。尤其是那些结合序列比较短、信息量不够高的转录因子比如Sp1这种GC-rich结合因子预测出来的假阳性率高得离谱。另一条路就是实验手段。标准做法是做一个ChIP-qPCR或者ChIP-seq先用抗体把目标转录因子拉下来再做测序得到全基因组结合图谱。这条路的结果当然是金标准但代价也摆在那里一个ChIP-seq样本从细胞培养、交联、超声破碎、免疫沉淀、建库到测序周期至少两三个月经费消耗也不小而且抗体质量、细胞状态、处理条件任何一个环节出问题数据质量就可能不过关。对一个还没发表研究的新因子来说做这一套实验是有风险的对大量已经被研究过、公共数据里已有足够ChIP-seq数据的转录因子来说重复劳动同样没意义。ChIP-Atlas的存在恰好把这两条路的优点结合了起来同时又避开了各自的坑。它不依赖任何预测模型所有结合位点都来自真实实验数据可靠性和motif预测完全不在一个层级它又不需要你自己去做实验因为别人已经做过并把数据公开了你要做的只是去检索和整合这些数据。我第一次用ChIP-Atlas的场景我记得很清楚当时做的是一个还在起步阶段的课题需要确认某个转录因子MAZ是否直接调控一个长链非编码RNA的转录。文献里有间接证据支持但缺乏直接结合证据实验排期又排得很满。当时我用ChIP-Atlas查了一下发现MAZ在这个lncRNA转录起始位点上游200bp处有一个非常强的peak而且整合了多个细胞系的数据信号一致性好这给了后续实验很强的预测依据。后来的ChIP-qPCR也验证了确实是直接结合。这个经历让我对ChIP-Atlas的数据质量建立起了信任。2. ChIP-Atlas 3.0核心功能拆解3.0版本和旧版本相比整体布局和核心功能没有翻天覆地的变化但在数据覆盖量和分析工具上做了不少升级。进入主页之后能看到几个核心模块Peak Browser结合位点浏览器、ChIP Target Genes靶基因检索、Signal Comparison信号比较、Differential Binding差异结合分析。下面逐个拆解。2.1 Peak Browser全局视角看结合位点分布Peak Browser是ChIP-Atlas最基础也最常用的功能模块。它做的事情是提供全基因组范围内的peak可视化你可以指定一个转录因子、一个细胞类型或组织然后选择基因组版本就能在浏览器中查看该因子在所有已收录实验中的结合位点分布。进入Peak Browser之后页面会让你选择物种3.0支持人类hg38/hg19、小鼠mm10/mm9、大鼠rn6、果蝇dm6、斑马鱼danRer等、抗原类型转录因子、组蛋白修饰等、细胞类型可以选具体的细胞系、组织或原代细胞以及阈值Q value。提交之后你会得到一个表格列出所有符合条件的不同实验条件下测到的peak。值得注意的是不管选哪一项都会有一个Threshold参数默认值通常是Q 1e-4。对初学者来说这个阈值可以理解为peaks的可靠程度——Q值越小过滤得越严格留下来的peak可信度越高。如果你刚开始做探索性分析、不想漏掉太多潜在的结合位点可以放宽阈值但如果要做比较严谨的结论我还是建议保持默认或者更严格。实际用的时候Peak Browser最重要的一项操作是输入基因名看该基因附近有哪些TF结合。我在后面的实操章节会具体演示这个过程。这里先提个核心概念——peak到底是什么。在ChIP-seq数据分析里一个peak就是一个信号富集的区域通俗地说就是转录因子实际结合上去的那一小段DNA区间通常是200~500bp。数据库把这些peak按坐标标注好再跟已知基因的注释做比对就能得到哪个基因附近有哪个因子结合这一层信息。2.2 ChIP Target Genes正反向检索靶基因Peak Browser解决的是看全局分布的问题ChIP Target Genes模块才是真正回答某个因子调控哪些靶基因或者某个基因受哪些因子调控这两个最常见问题的入口。这个模块的操作方式非常直白你选择物种后可以填转录因子名称查靶基因也可以填基因名称查调控它的转录因子。提交后系统会比较所有已经被收录的peak和基因注释信息输出一个列表。这个列表标出了基因名、peak距离转录起始位点的位置、peak的Q value、以及参与该记录的实验来源等。这里有一个概念需要理清楚ChIP-seq peak落在基因附近代表的是该因子在这个基因的调控区域有结合证据但这不能直接等同于这个基因就是这个因子的靶基因。因为ChIP-seq只能说明物理层面的结合没法直接说明功能层面的调控效应。结合和调控之间的关系还需要配RNA-seq数据来分析——基因的表达是否因为该因子的结合发生了变化。ChIP-Atlas的实际工作方式更像是一个结合证据数据库它给出的是结合关系和证据强度至于这个结合有没有引起转录变化还需要你自己结合表达数据做判断或者用数据库里的表达数据模块来辅助分析。2.3 ChIP-TS和Signal Comparison从结合到功能调控这是3.0版本比较有含金量的升级部分。ChIP-TS全称是ChIP-Transcription-factor Separation它可以在一个因子有多个实验记录时把这些记录分成几类分别代表该因子在不同条件下的结合模式。这个功能做起来其实有点难度——如果你单纯看一个转录因子的所有peaks它们可能是多个细胞类型、处理条件、生物学背景下混在一起的结果直接平均会丢失很多信息。ChIP-TS帮你把这些混合信号分离开来找出一致的结合模块和特异性的结合模块这个问题对理解转录因子在不同细胞状态下的功能差异很有帮助。Signal Comparison和Differential Binding是配合使用的功能。你可以选择两个条件下的ChIP-seq数据同一因子在不同处理下或者同一条件下不同因子数据库会做信号比较并在基因组浏览器上显示两组的信号差异。举个例子你可以把DMSO处理的细胞和某个药物处理的细胞分别设为对照组和处理组看同一个转录因子的结合峰在这两种条件下有哪些被增强、哪些被减弱、哪些是两组共有的。这些差异peak可以直接导出列表为后续分析提供候选区域。这个功能在我自己接触过的案例里非常实用。之前调研某个转录因子在炎症刺激下的动态变化用的就是Signal Comparison模块。选好了巨噬细胞静息状态和LPS刺激状态的两组ChIP-seq数据比较结果清清楚楚地显示出原有结合的增强、减弱以及新出现的结合位点分布。如果自己处理这些原始数据光是对齐和归一化就够折腾好几天数据库直接给出结果至少省了两三天时间。2.4 数据来源与覆盖范围ChIP-Atlas 3.0最大的底气来自数据量。根据官方统计3.0整合了约11.3万个公共样本的ChIP-seq数据覆盖人类和小鼠等主流模式生物抗原类型也做了分类扩展。从2.0时期的转录因子、组蛋白修饰、RNA聚合酶三类补充了更多类的染色质结合蛋白和DNA结合蛋白。数据来源方面它抓取的是NCBI SRA、DDBJ、ENA等公共测序数据库中的原始数据然后通过统一的清理、比对、call peak流程处理。这一步很关键因为不同实验室提交的数据质量参差不齐、比对方法五花八门如果不做一致性处理直接拿来比较是不公平的。ChIP-Atlas的团队为此做了统一流程并保留了QC信息你可以在每个peak记录里看到对应的实验编号SRX开头和元数据。3.0版本还更新了参考基因组版本人类数据默认以hg38为参考也兼容hg19。这里有一个实操建议如果你是做人类基因相关分析优先选择hg38毕竟hg19的老注释对基因名称和位置的兼容性在变差如果遇到某些早年的公共数据库样本只有hg19比对结果的情况系统也会做协调处理但你心里得有数。3. 实操案例用一个转录因子查靶基因功能说得再多不如走一遍完整流程。我用一个相对具有代表性的例子来演示——假设我现在想知道在人类细胞中转录因子MAZ的结合位点主要分布在哪些基因附近。挑MAZ这个因子有两个理由一是它在公共数据里的ChIP-seq样本数量不算少能展示多个细胞系的结果二是它属于比较典型的看motif预测基本没法用的因子正好体现ChIP-Atlas的真实价值。3.1 在Peak Browser里看MAZ的全基因组结合图谱第一步打开ChIP-Atlas主页chip-atlas.org点击Peak Browser入口。进入界面后按顺序选择Species选择Human(hg38)Antigen选择MAZ输入后系统会做自动补全确认名字后面的名称标准无误Cell type如果先选了All(全部)那结果会非常大建议先限定一个具体的细胞类型比如K562这是一株被广泛研究的慢性粒细胞白血病细胞系ENCODE项目里做了大量ChIP-seq这样结果更可控Threshold保持默认的Q 1e-4其他选项如IgG control等保持默认。提交之后页面会渲染出一个包含多个表格的视图。表格的每一行对应一个实验条件下的一个peak区域关键信息包括染色体位置、长度、Q值、距离最近的基因等。页面上的基因组浏览器可以直接点击跳转你能够看到MAZ在某一个具体实验里的结合信号在染色体上的覆盖情况。这个步骤的重点是培养全局感知——你在结果列表里可以看到MAZ在K562细胞里的结合分布大概有几千个peaks分布在所有染色体上。有些区域peak信号很强Q值非常小这些往往是MAZ高度富集的位点有些区域peak比较弱那就是结合不太稳定的位点。你还可以用页面上的过滤和排序功能按Q值排序、按染色体过滤快速锁定感兴趣的候选区。3.2 用ChIP Target Genes做反查靶基因想要系统性地得到MAZ的候选靶基因列表可以直接用ChIP Target Genes模块。操作入口在主菜单上点击之后选择相同的物种设置然后在转录因子输入框里填MAZ提交。结果页会把MAZ在哪些基因的转录起始位点附近有结合peak列成一张表。这里有三个需要重点理解的指标。第一个是基因名称。这个列表里的基因不全是MAZ的靶基因——它表示在这些基因的附近有MAZ的ChIP-seq结合信号。距离TSS越近通常认为直接调控的可能性越大但也不是绝对的因为有些转录因子的调控区域可能在增强子等远端元件上未必紧挨TSS。第二个是位置信息。ChIP-Atlas会标注peak离TSS的距离有时候结合位点落在TSS上游几百bp的启动子区有时候落在基因内部甚至远端。如果选所有距离的选项列表会特别大建议一开始可以设置距离TSS 1kb以内或者5kb以内作为过滤条件优先看启动子区域的结合这是保守稳妥的做法。第三个是Q值。列表里每个peak都带一个Q value基于该peak在实验组和对照组之间的富集显著性做多重检验校正得到的。Q值越小代表结合信号越显著。排列表格时优先看Q值小的记录这些是最有信心的结合事件。筛选出一个候选靶基因列表之后下一步就是去验证。你可以把表格导出然后去UCSC Genome Browser或者IGV里手工查看每个基因位点的CHIP-seq信号图确认peak是否真的落在合理的调控区域启动子、第一个外显子附近等。批量验证时还可以把列表里的基因提交到DAVID或Enrichr做GO和KEGG富集分析看看这些基因整体富集在哪些生物学通路里从功能层面判断是否符合预期。3.3 从靶基因反推上游转录因子上面说的是一个因子找多个靶基因的正向检索实际操作中一个基因查上游因子的反向检索同样常用——比如你有一个感兴趣的基因想知道它受哪些转录因子调控ChIP Target Genes允许你切换查询方式把基因名称作为输入输出比对到的转录因子列表。这种模式在课题设计中很有价值。举个例子假设我关心某个在肿瘤耐药中高表达的基因ALDH1A3想找上游调控它的转录因子就在输入模式里改成基因名ALDH1A3提交后得到一堆在该基因附近有ChIP-seq结合信号的转录因子。再根据以下标准做排序Q值要小、peak距离TSS近、在多个细胞类型中有重复证据。最后筛出来的转录因子才值得进入后续实验验证效率和盲猜完全不一样。另外一个交叉验证的实用思路是这样的——运行JASPAR做motif预测得到一批理论上可能结合该启动子的转录因子再运行ChIP-Atlas反向检索得到一批实验上在该位点有结合的转录因子两个列表取交集交集部分就是既有motif基础又有实验证据的候选因子优先级最高设计验证实验的时候优先从这些因子入手。这个思路的意义在于JASPAR回答的是序列上能不能结合ChIP-Atlas回答的是真实细胞里有没有结合两者互为参考配合使用能把假阳性率压得很低。4. ChIP-Atlas与JASPAR的互补使用策略既然搜索引擎热词里带了JASPAR这个部分展开说一下两者怎么搭配。JASPAR是一个开放获取的转录因子结合位点数据库核心资源是每个转录因子的位置权重矩阵PWM。这种矩阵本质上代表的是这个因子结合DNA时对每个位置碱基的偏好性。用FIMO扫描一个基因的启动子序列得到的motif匹配位点就代表序列层面有可能结合。这个有可能非常重要因为转录因子要结合到一个位点上首先该位点的序列必须符合它的结合偏好这是结合的必要条件而不是充分条件——DNA是否暴露、染色质是否开放、有没有其他因子竞争、辅因子是否存在这些都决定了最终实际能不能结合。ChIP-Atlas的互补性体现在它提供的是实验结果而非序列预测。它告诉我们的是在真实细胞的生理状态下这个因子确实结合在了这里。但反过来ChIP-Atlas也不可能覆盖所有因子和所有条件——那些还没有人做过ChIP-seq的新因子、或者只在极端特殊条件下才起作用的因子数据库里可能就是空白。这时候你只能求助于JASPAR。所以正确姿势是双向验证。我举两个场景。场景一我有一个转录因子想知道它的直接靶基因。先在ChIP-Atlas里查它在目标组织或细胞系里的peaks和候选靶基因把结果列表导出然后提取这些候选基因的启动子序列TSS上游2000到下游500用JASPAR的PWM矩阵做FIMO扫描验证这些基因的启动子区域是否确实存在该因子的motif匹配位点。如果某些基因的启动子连motif都没有那大概率不是直接结合而是增强子结合或者数据噪声需要单独处理。这个流程既利用了实验证据又利用了序列特征两方面都过关的靶基因就非常扎实了。场景二我有一个基因没有任何ChIP-seq数据支持它的上游调控因子。此时用JASPAR扫描它的启动子序列得到一批预测因子但不知道哪些是真的。这时候你有两种验证路径一是去ChIP-Atlas里查这批预测因子在相关细胞类型里有没有结合数据看看他们在目标基因的TSS附近是否有真实peak二是做湿实验设计siRNA敲低其中两三个因子看目标基因的表达是否受影响。从成本角度考虑优先挑那些在ChIP-Atlas里碰巧也有peaks记录的因子来开刀出结果的概率要大得多。还有一个细节值得留意JASPAR的物种覆盖和版本。JASPAR提供了人类、小鼠等多个物种的矩阵但不同物种的转录因子家族保守性很高很多人类矩阵可以直接用于小鼠序列扫描反之亦然。ChIP-Atlas的peak数据虽然是按物种区分存放的但跨物种比较时比如人MAZ和小鼠Maz蛋白序列高度保守结合基序也基本一致很多研究直接参考跨物种的数据也说得通。不过严谨起见跨物种引用时建议在文章里做好说明。5. 3.0版本的新功能与使用经验ChIP-Atlas 3.0发布之后大部分用户一开始可能感觉界面跟2.0差不多但实际用下来有几个改动对分析效率的影响特别大。5.1 数据总量和样本分类的扩充3.0对公共数据做了扩容。对人类、小鼠的研究来说新增的样本覆盖了很多之前查不到的组织和细胞类型尤其是疾病相关的样本。以前做某些疾病靶基因分析搜索特定转录因子的数据时经常显示No records found3.0里这类空白少了一些。如果你要查的是偏门的转录因子记得留意数据覆盖范围不要因为查不到结果就直接断言没有结合更可能的解释是还没人做过这个实验。5.2 ChIP-TS和差异结合分析的实际用法我前面提过ChIP-TS这个功能它解决的是一个很实际的问题——当一个转录因子在多个细胞系、多种条件下都有ChIP-seq数据时不同条件下结合的共性和特异性会被淹没在噪音里。ChIP-TS输出会把peaks分成若干类其中一类是几乎所有条件下都稳定结合的peaks代表了这个因子的核心结合谱另一类是只在特定条件下出现的peaks代表条件特异性结合。做课题设计时核心结合谱适合用来判断该因子的基本功能条件特异性结合则适合用来研究它在某个生理病理过程中的特殊作用。Differential Binding的用法类似而且操作更加直观。你只需要选择同一个因子的两组数据比如对照组和处理组它会在全基因组范围内做信号比较列出显著差异的peak。用这个功能之前我有一个建议尽量保证两组的细胞类型和实验条件只有单一变量差异否则比较结果的解释会有歧义。数据库里很多公共数据的背景条件并不完全一致挑选前一定要看清实验元数据。5.3 API访问与批量处理ChIP-Atlas提供了一套简单的API接口可以不用通过网页界面直接用命令行或脚本请求数据。对需要批量处理几百个基因、几百个因子的场景来说API远比手动点击高效。API的基本请求方式很简单比如查询某个转录因子的靶基因列表可以用如下格式的请求curl https://chip-atlas.org/api/target_genes?species9606antigenMAZquery_typeproteinformattsv把species换成对应物种的taxonomy ID人类9606、小鼠10090antigen换成因子名称返回的就是TSV格式的靶基因表。写个简单的Python脚本循环遍历一个因子列表一天之内能处理完以前在网页上点击大半天才能搞定的分析规模。更进阶的用法是把API拿到的结果直接存成DataFrame然后在本地方便地做交集、过滤、可视化。我写过一个小脚本输入一组转录因子名称循环请求每个因子的靶基因列表把距离TSS 1kb内的基因汇总成一个并集再用这些基因去做下游富集分析整体效率提升非常明显。6. 常见问题与坑点排查用了这么长时间我总结了一些常见的坑和对应的处理方式这些都是实操中容易卡住的地方。6.1 查不到某个转录因子的数据这是最常遇到的问题。原因一般有三类一是该因子确实还没有任何公共ChIP-seq数据这种情况除了等数据库更新别无他法二是因子名称的别名问题。很多转录因子有多个叫法比如MAZ有时也叫Zif268相关的名称数据库收录时可能只用了其中一个标准名。解决方式是先用UniProt或GeneCards查清楚这个因子的所有别名再在ChIP-Atlas里逐一尝试三是该因子有数据但你不小心选错了物种或细胞类型。数据库的默认界面会提示当前过滤条件先检查一遍再下结论。6.2 Peak Q value怎么选Q value的选择取决于分析目标。做严格的目标基因筛选建议选1e-4甚至更小做探索性分析、希望看到更多候选位点可以把阈值放宽到1e-2。放宽阈值后出现的peaks可能混入非特异性结合信号但可以用来做整体分布趋势的观察。还有一个细节是ChIP-Atlas网站里Threshold选项含义可能因页面不同有所变化有些页面显示的是阈值过滤方式比如Q value 指定值有些页面显示的是soft/hard阈值在使用前先确认清楚。6.3 结合peak在基因附近不等于直接调控这是新手最容易犯的认知错误。一个转录因子在某基因附近有结合peak只能说明存在物理上的结合证据但不能证明这个基因的表达一定受这个因子调控。一个转录因子结合了一个位点却没有改变基因表达这种情况在生物学里非常普遍。所以做结论之前建议结合RNA-seq数据无论是公共数据还是自己做的来验证该因子被敲低或过表达之后这个基因的表达是否发生了变化。如果条件允许做CRISPR或者ChIP-qPCR这样的湿实验才是最终的验证标准。6.4 公共数据本身的质量问题ChIP-Atlas整合的数据来自全球各地的实验室质量差异客观存在。有的数据没有做input/IGG对照有的数据比对率很低有的抗体特异性本身存疑。ChIP-Atlas虽然做了统一处理并提供了QC信息但使用时还是得多个心眼。实操上当一个因子的peaks结果分布在几百个基因上而另一个因子只有几十个可以先去查看每个实验对应的原始记录看看有没有对照组、抗体货号、细胞系名称再决定数据的可信度。如果同一个因子在多个独立实验中都能得到同一个peak那就是高度可靠的结合事件如果只有一个实验里出现就要保持谨慎。6.5 版本差异3.0版本按不同物种分别使用不同参考基因组版本人类默认hg38。早年的公共数据很多基于hg19所以不同版本之间peak坐标不完全一致。如果后续分析要用其他工具比如VEP注释注意坐标版本要统一免得出现错误注释。ChIP-Atlas的页面上可以切换版本建议所有查询保持一致。7. 从数据库结果到课题设计的个人建议最后聊一点方法论层面的东西。ChIP-Atlas这类数据库工具的价值不只是帮你查一个结果而是帮你在课题设计阶段低成本地做出高质量的假设。比如你想研究一个转录因子在某个疾病里的功能。以前的做法是查文献看这个因子跟疾病的相关性报道然后凭直觉选一个下游基因开始做实验风险很大可能做了一年发现选错了靶基因。用ChIP-Atlas的做法则是先把这个因子在疾病相关组织或细胞类型里的peaks和候选靶基因全部拉出来再跟疾病相关的差异表达基因列表做交集交集部分就是这个因子可能调控的疾病相关直接靶基因。这两步纯靠数据库分析就能完成做实验之前已经把范围缩小到很可能正确的方向上。再比如你想研究某个基因组区间的调控机制。你可以用ChIP-Atlas查这个区间在哪些因子的peaks覆盖范围之内然后根据结合强度和重复性排出候选调控因子。这个方法在处理疾病风险位点GWAS SNP所在区域时尤其好用——很多风险位点落在非编码区用ChIP-Atlas能立刻找到该区域有哪些转录因子的结合证据为后续功能实验提供明确的切入点。我个人这几年的一个体会是数据库工具用得好的关键不是记住每个按钮在哪而是建立起一套自己的分析路径先想清楚我要回答什么生物学问题然后把数据库检索当成策略性工具来使用——哪些结果可以直接用来支持假设哪些结果有噪声需要排除哪些问题数据库根本回答不了必须回到实验台。这样用ChIP-Atlas它的价值会远远超过一个能查数据的网站。如果你刚开始接触转录因子调控分析我建议先把ChIP-Atlas的Peak Browser和ChIP Target Genes这两个模块玩熟再逐步尝试ChIP-TS和Differential Binding。上手之后你会发现很多以前需要一两个月的干活流程现在一两天就能跑完而且有据可查。至于JASPAR这类预测工具把它们当作ChIP-Atlas的互补而不是替代——一个解决细胞里真实发生了什么一个解决序列上可能存在什么两个角度合在一起才是一份完整的证据链。