ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

16S rDNA测序数据提交NCBI SRA完整操作指南

16S rDNA测序数据提交NCBI SRA完整操作指南 1. 为什么这篇操作详解值得你花20分钟读这几年做微生物组研究的人越来越多16S rDNA扩增子测序几乎是入行标配。但一个很现实的问题卡住了不少人数据在本地跑完了QIIME2、跑完了LEfSe文章写完了结果投稿时期刊要求提供NCBI accession number这时候才发现自己根本不知道数据往哪儿传、怎么传、传上去之后怎么跟踪状态。我最早提交SRA的时候也踩过不少坑光是BioSample属性表就被打回过三次当时论坛上翻到的教程都写得比较零散很多细节要靠自己试错。这篇博文就是冲着“提交NCBI”这个具体环节去的。我尽量把从原始数据准备、文件整理、BankIt网页提交、BioSample属性填写到拿到SRA登录号并追踪评审状态的完整流程都写清楚。无论你现在是用QIIME2、mothur还是DADA2做完了分析只要手里有16S rDNA的原始FASTQ文件这篇文章都能直接当操作手册用。文中涉及的操作我都按NCBI目前实际在用的页面流程来写没有用旧版本截图里的过时菜单。适合谁来读正在准备投稿、被期刊要求提供数据编号的科研人员需要组内统一数据上传规范、帮学生或同事处理上传事务的实验室管理员以及所有想在数据共享上少走弯路的人。对NCBI页面英文界面不太熟、或者第一次接触SRA和BioSample概念的朋友读完这篇也能自己动手传一次。2. 上传前必须做好的数据准备这一步没做对后面全是白忙2.1 先判断你要上传哪个“库”不是所有数据都进SRA提到NCBI提交测序数据多数人第一反应就是SRASequence Read Archive。这没错原始测序FASTQ文件确实统一归SRA管。但16S rDNA项目还有一个容易忽略的关联库BioSample。严格来说每个SRA实验Experiment都必须在提交时关联一个已经创建好的BioSample里面记录着这个样本的来源环境、宿主信息、采样地点等元数据。简单理解BioSample是“样本户口本”SRA是“原始数据仓库”两者绑定在一起才构成完整的可追溯链条。至于Bioproject它是更高一层的项目汇总可以包含多个SRA实验和多个BioSample。对大多数只有一批16S数据的课题来说直接建一个Bioproject再往里面挂样本和数据就够了。如果课题组有多个相关实验设计比如同批次还做了宏基因组或者ITS扩增子也建议统一放在一个Bioproject下管理后面写文章引用起来很清爽。2.2 文件命名规范机器不认中文更不认“最终版”在打开NCBI任何提交页面之前我强烈建议先把本地数据文件整理一遍。NCBI并不强制规定FASTQ文件的具体命名格式但有一个硬性要求同一对双端测序的两个文件必须能通过文件名清楚区分R1和R2而且这组文件最终会跟你的BioSample一一对应。我在实践里养成的习惯是这么命名的项目代号_样本编号_引物区域_L001_R1_001.fastq.gz 项目代号_样本编号_引物区域_L001_R2_001.fastq.gz比如说GutMicrobiota_S01_V34_L001_R1_001.fastq.gz。这种命名方式的好处是后期在Bioproject页面里核对样本与文件对应关系时人眼扫过去就能看出哪个R1配哪个R2。很多下机数据从测序公司拿到手时文件名往往是一长串看不懂的编号我强烈建议先统一重命名再上传否则后面在SRA页面上一旦传错文件改起来非常费劲。文件格式方面NCBI现在更推荐上传压缩后的FASTQ格式.fastq.gz。注意这里指的是gzip压缩不是别的压缩方式。你可以先用gzip命令处理原始数据上传前自己解压看一眼文件内容是否完整。顺手检查一下文件大小是否跟测序下机的产出量对得上如果某个样本的gzip文件明显异常小大概率是测序或者拆分时出了问题这类问题一定要在数据上传前发现别把坏数据提交上去。2.3 样本信息表BioSample属性填写的“弹药库”这里我要重点展开因为这是整个提交流程里最容易翻车的环节。NCBI要求每个BioSample提供一套结构化属性具体字段因样本类型而异植物样本、动物样本、环境样本、微生物分离株的要求都不一样。对于16S rDNA研究最常见的样本来源无外乎这几种肠道内容物或粪便样本human gut, mouse gut等环境样本土壤、水体、活性污泥植物根际或叶际样本临床样本如痰液、肺泡灌洗液不同类型的样本NCBI要求填写的核心属性差别很大。以人类肠道微生物研究为例至少需要提供宿主host、宿主性别、宿主年龄或年龄区间、采样国家/地区、采样日期、样本来源如粪便或肠黏膜。如果是环境样本则通常需要经纬度、采样地描述、环境介质如土壤类型、采样深度等。我建议在开始NCBI提交前先做一个Excel格式的样本信息总表每一行是一个样本每一列是一个属性字段。这样做的好处有两个一是提交时可以直接从表里拷贝内容不用一个个样本去回忆二是多人协作时这张表就是团队统一的信息标准。另外我习惯在表格里额外添加两列一列写样本的16S测序引物序列另一列写目标区域如V3-V4这在后面填SRA实验的Library Description时可以直接引用。2.4 提前准备的项目信息草稿还有一个经常被忽略的准备工作把项目信息Project Info、文献引用信息、数据释放时间等内容提前写在文本文件里。NCBI提交界面有超时限制如果一边填一边想经常会出现填到一半页面超时、前面内容白填的情况。我通常在本地建一个submit_notes.txt把下面的信息提前写好项目标题和简要描述课题负责人联系方式姓名、单位、邮箱NCBI还会要求提供一个通信作者或者数据负责人的信息资助项目编号如果有的话计划数据公开时间默认是文章发表时公开也可以选择立即公开是否关联已经发表的文献如果文章在投或者已接收需要提供PMID或期刊名、稿件编号把这些信息备好提交过程会很顺畅不用在中途去翻邮箱找资助编号。3. 实操全程BankIt入口到SRA数据上传一步步跟做3.1 进入正确的提交入口SRA Submission PortalNCBI的数据提交入口其实有好几个但SRA和BioSample有两个不同的Portal很多新手就是在这里绕晕的。正确的流程是打开NCBI主页登录你的账号。没有账号就注册一个这个账号会关联你之后所有提交的Bioproject、BioSample和SRA记录。在主页顶部的下拉菜单里找到“Submit”入口或者直接访问提交总览页面。在提交类型列表里选择“SRA”或“BioSample”两者会分别打开不同的流程。这里有个关键点如果是全新的课题没有建过Bioproject和BioSample直接从SRA Submission Portal开始反而更顺因为SRA流程里会引导你同时创建Bioproject和BioSample。如果你已经单独提交过BioSample那么直接选SRA并关联已有BioSample即可。NCBI现在对“Sequence Read Archive (SRA)”提交统一使用BankIt式的网页交互界面不再需要老的SRA FTP上传方式。整个页面分七个大步骤Submitter、General Information、Project、BioSample、SRA metadata、Files、Review Submit。下面我按实际填写顺序逐项拆解。3.2 Submitter与General Information谁能替你接收邮件进入SRA提交页面后第一步先填Submitter信息主要涉及提交者姓名、单位、邮箱。这里有一个细节需要特别提醒NCBI系统会默认用你账号注册邮箱作为通讯邮箱但你可以在这个页面把实际收件人改成实验室另一位负责数据管理的成员。凡是后面跟提交相关的邮件通知比如评审驳回、登录号正式分配、release时间确认都会发到这里的邮箱千万别填一个不常看的地址。第二步General Information里会让你填写提交标题Submission Title和提交描述。Submission Title建议跟文章标题或者课题代号保持一致方便日后检索对应关系。比如“16S rRNA amplicon sequencing of gut microbiota in type 2 diabetes patients”这种写法就够用。这里的描述可以简单写一下研究目的和样本概况NCBI会把它作为提交的基本索引信息展示。Data release date这一项需要注意。NCBI默认的释放时间是文章正式发表日期你也可以手动指定一个日期让它提前公开。一般建议保持默认除非期刊或者评审要求数据在投稿当天就必须可公开访问。我自己的操作习惯是选择“release when paper published”这样数据在文章接收前不会对外可见避免被别人抢先引用。3.3 Bioproject创建项目就是数据集的“文件夹”如果新课题还没有BioprojectSRA提交流程会引导你新建一个。Bioproject的创建表单核心信息包括Project title、Project description、Project type。Project type选择“Research project”即可如果课题是环境宏基因组相关还可以考虑“Environmental project”。这里有一个容易混淆的点Bioproject的外部引用External Link和生物样本BioSample是被分开管理的各自有独立登录号。在建Bioproject时会让你填写这个项目涉及的目标Objectives等信息并不是强制全部字段都填完但建议把Project Description写清楚日后在文章补充材料里粘贴Bioproject链接时审稿人点进去能一眼看出项目是干嘛的。新建Bioproject完成后系统会分配一个以PRJNA开头的登录号并提示后续继续SRA提交。如果你已经有现成的Bioproject直接在SRA流程里选择已有项目并关联它即可。3.4 BioSample信息表两种填写方式选适合自己的这是整个流程中最需要耐心的步骤。NCBI的BioSample提交支持两种填写模式在线交互式表单适合样本数量比较少10个以内的情况批量上传制表符分隔的表格适合几十上百个样本的情况如果你只有二三十个样本直接在线表单问题不大但超过这个量强烈建议用批量模式。NCBI会提供一个tsv模板文件模板里包含了一长串属性列其中包括必填项橙色标记和选填项。不同sample package对应不同的必填属性通常选“Microbe”或者“Environmental/Metagenome”相关的package就能覆盖16S研究的常见需求。我踩过的一个坑是属性列中有些字段需要满足受控词汇表比如经纬度必须是十进制度数而不是“N 39°54”这种格式。还有日期格式必须是YYYY-MM-DD如果只提供年份NCBI有可能会打回。所以填批量表格的时候要格外仔细我一般会先填两行做test提交后看系统有没有报错再补全剩余样本。如果要省时间可以先只提交三个样本走通全流程后再回到BioSample页面把剩下的批量补传然后在新SRA提交中关联完整样本列表。再提醒一个很重要的字段sample_name最好不要包含空格、斜杠和括号建议全部使用下划线和字母数字组合。NCBI系统对这类特殊字符虽然不拒绝但后续下载SRA metadata的时候容易出现解析问题。3.5 SRA metadata填写样本与文库信息对应关系SRA这一步要填写的是每个样本的文库信息。页面会列出一个样本清单每个样本需要填写Library strategy一般是AMPLICONLibrary source一般是GENOMICLibrary selection一般是PCRLibrary name可以随便起但建议跟本地文件前缀一致Sequencing platform根据测序平台选择比如IlluminaInstrument model具体型号如Illumina MiSeq、HiSeq 2500、NovaSeq 6000Insert size / read length如果双端测序insert size填目标片段长度加引物长度后的期望值read length填150或250之类的实际读长Forward primer / Reverse primer sequence这里需要填实际引物序列比如341F/805R就是CCTACGGGNGGCWGCAG和GACTACHVGGGTATCTAATCCTarget region如V3-V4或者V4重点说两个容易错的点。第一Platform和Instrument model必须匹配你真实的测序情况不能随便选“Illumina unspecified”。这个信息后续会影响SRA数据在不同工具下的兼容性如果有on instrument control数据或者basecall版本信息也可以填。第二如果你用的是515F/806R这类经典V4引物引物方向要填好NCBI并不强制要求但某些审稿编辑器会据此判断你的数据质量。如果样本数量很多SRA提交页也提供批量上传。批量上传模板里每个样本一行除了样本名还要填一个“library ID”。SRA系统不要求这个ID全局唯一但最好跟文件名对应。3.6 Files上传双端文件配对和压缩格式SRA metadata填完接下来就是上传FASTQ文件。这一步的操作界面很简单但最容易出问题。页面会针对每个样本列出你需要上传的文件位置。你需要在本地把.fastq.gz文件拖拽上传或者选择NCBI提供的FTP上传方式。如果文件较小比如一个样本几十MB网页上传完全够用。如果文件很大比如一个样本的FASTQ有5GB以上网页上传非常容易断线建议改用FTP。双端测序文件的配对逻辑需要特别小心。以Illumina双端为例每个样本的两个文件会被SRA系统自动识别为R1和R2前提是你在上传时按照R1文件、R2文件的顺序正确对应。NCBI文档里有一个很重要的提示如果文件名包含“R1”和“R2”这样的标识系统会自动配对成功如果文件命名不含R1/R2系统可能会把每个文件识别成独立的single-end run这会导致数据信息错乱。我自己的习惯是在上传页面的文件列表里逐个核对每个样本对应的两个文件必须同时出现并标记为matepair。千万别图省事拖拽整个文件夹那样容易让多个样本的文件混到一起后面检查的时候头疼。上传结束后页面会进入Review Submit。这时系统会生成一个汇总清单包含Bioproject登录号、BioSample数量、SRA实验数量、文件列表大小等。建议把这一页完整截图存档万一后续有争议或者数据被误删这个截图可以作为提交记录凭证。4. 把你的特定数据集套进去一个双端16S提交的完整演示4.1 示例背景与样本设计为了把上面这些抽象步骤落到实操层面我用一个典型的案例来模拟某课题组研究两种不同饮食干预对小鼠肠道菌群的影响设置了对照组Control和处理组Treatment每组各10只小鼠一共20份粪便样本。提取DNA后对16S rRNA基因V3-V4区域进行PCR扩增使用Illumina MiSeq平台进行双端300 bp测序。本地数据目录长这样rawdata/ ├── C01_S1_L001_R1_001.fastq.gz ├── C01_S1_L001_R2_001.fastq.gz ├── C02_S2_L001_R1_001.fastq.gz ├── C02_S2_L001_R2_001.fastq.gz ... ├── T10_S20_L001_R1_001.fastq.gz └── T10_S20_L001_R2_001.fastq.gz这20个样本一共产生40个FASTQ文件每个文件约120 MB。下面把整个提交流程的关键节点演示一遍。4.2 逐项填写示例从Project到BioSample打开SRA Submission Portal登录账号后选择“New submission”在项目信息Page创建Bioproject时Project titleEffect of dietary interventions on gut microbiota composition in C57BL/6 miceDescriptionWe investigated the impact of a high-fiber diet and a high-fat diet on the gut microbiota of C57BL/6 mice using 16S rRNA gene amplicon sequencing (V3-V4 region, Illumina MiSeq 2x300 bp). Fecal samples were collected at week 8 post-intervention.Project typeResearch project计划公开时间选择 release with publication提交后拿到Bioproject登录号比如PRJNA1234567。接着进入BioSample步骤由于样本数量是20个我选择批量上传模式。先从NCBI下载BioSample attributes模板在里面逐样本填写sample_namehosthost_agehost_sexcollection_dategeographic_locationtissueC01Mus musculus8 weeksmale2024-03-15China: BeijingfecesC02Mus musculus8 weeksmale2024-03-15China: Beijingfeces.....................T10Mus musculus8 weeksfemale2024-03-18China: Beijingfeces这里特别强调geographic_location这一列标准格式是“国家: 地区”比如“China: Beijing”不要写成“Beijing, China”否则NCBI系统解析的时候可能出问题。如果样本来自多个地点就分别填写对应的地点字符串。4.3 SRA metadata与文件上传的对应关系演示批量填完BioSample之后SRA metadata页会自动从BioSample导入样本名。这里需要给每个样本填写Library和Platform信息。因为整个项目的文库构建方式一致可以直接用页面的batch editing功能一次性给所有样本赋相同的Library参数Library strategyAMPLICONLibrary sourceGENOMICLibrary selectionPCRPlatformILLUMINAInstrument modelIllumina MiSeqForward primerCCTACGGGNGGCWGCAG341FReverse primerGACTACHVGGGTATCTAATCC805RTarget regionV3-V4Read length300文件上传时我直接用网页上传入口20个样本、40个文件逐个选好R1和R2的配对关系。这里的一个小经验是先上传所有R1文件再上传所有R2文件按照文件名排序后批量勾选配对效率比逐个拖拽高很多。4.4 Review Submit后的登录号判读提交并成功校验后NCBI会生成SRA实验登录号SRX、SRA Run登录号SRR同时BioSample会有SAMN开头的登录号Bioproject是PRJNA开头。这四个编号的关系会在NCBI页面上清晰展示。文章里需要引用的通常是Bioproject登录号PRJNA或者SRA登录号SRR期刊要求不同按期刊指示填写。从提交到正式公开NCBI一般需要两三个工作日进行数据质量检查和元数据审核。如果状态变成public你的数据就能被全球检索到如果状态是in process或者on hold说明还没释放。提交后可以通过页面右下方的“Manage Submissions”查看历史提交和当前状态。5. 新手最容易卡住的四类问题与排查方法5.1 BioSample属性表被驳回的常见原因这是我在实操中遇到最多的一类退件。NCBI的工作人员会把BioSample里的必填项逐条审核一旦缺失或不规范就会在邮件中列出具体哪一行、哪个字段有问题。常见被打回的情况包括问题表现排查思路正确写法经纬度格式错误用了度分秒或带方向字母使用十进制度数例如39.9042 116.4074经度 纬度日期格式不可识别写了“March 2024”或“2024/03/15”使用YYYY-MM-DD格式缺少必需属性如host选了错误的BioSample package回到BioSample页面更换package或补充字段后重新提交缺少采样地点只写了“实验室”补充具体到国家或城市级别的信息5.2 文件上传到一半断线怎么办上传中断很常见。NCBI的网页上传在中断后一般会保留已经完整上传的文件块你可以重新进入该提交的Files页面接着传而不是从头再来。注意如果有文件显示“upload incomplete”建议删掉这个文件重新上传不要只续传剩余部分因为校验不通过会引发后续SRA文件解析失败。大文件场景下我更推荐用FTP。NCBI提供了一个upload文件夹用FileZilla等FTP客户端登录后把FASTQ文件放到指定的upload目录然后在网页提交页面选择“use existing FTP files”系统会自动扫描目录并关联文件。用FTP时文件名不能包含空格或特殊字符这一条也要提前遵守。5.3 提交后一直显示on hold什么时候才能公开on hold状态分两种情况一种是系统按你选择的“release when paper published”策略在文章正式见刊前一直保持数据不公开另一种是NCBI还在进行数据质控通常需要48到72小时最长不超过一周。如果超过一周还没变成public建议直接通过SRA support邮箱咨询附上提交编号。还有一种情况是你已经把文章投出去了但期刊没有跟NCBI产生自动关联数据无法随接收自动释放。这时可以登录提交页面手动把Release date改成当前日期或指定的提前日期。我遇到过合作实验室急着催数据公开直接在“Manage Submissions”里改掉release date过几个小时数据就可见了。5.4 引物序列填错或目标区域填反了怎么办如果你提交后才发现SRA metadata里的引物序列有误不用慌张。在数据公开前可以通过“Manage Submissions”打开对应提交点击SRA metadata步骤编辑引物序列后重新提交会生成一个新的SRA实验版本。数据公开后发现问题处理就麻烦得多需要联系SRA help desk说明情况所以提交前仔细核对引物信息非常重要。这里分享一个我自己的核对习惯在Review Submit的最终界面把页面展示的每行样本名、文库策略、文件名全部复制到Excel里跟本地的样本信息表做一次逐列比对重点看文件与样本是否错位。耗时不超过5分钟但能避免大多数数据错配事故。如果文件很多可以考虑写个小脚本按文件名批量核验。6. 从数据共享的角度聊聊提交策略与后续扩展很多人以为数据提交到NCBI就算完事了其实拿到登录号之后还有几个值得做的事情。第一把Bioproject登录号和SRA登录号写进文章的Data Availability Statement里这是期刊审查的硬性要求。第二建议在BioSample页面补充“related data”信息比如关联你已经上传的序列文件或原始数据方便读者快速跳转。第三如果后续补测了更多样本可以直接在同一个Bioproject下面新增BioSample和SRA实验不必为同一课题重复创建project。从课题组管理的角度我越来越觉得数据提交过程应该标准化。团队可以做一个固定模板的Excel表格里面存放所有标准的BioSample属性值、引物序列、Platform型号来新人之后按表格填即可避免每次提交都回到最初的低效试错。我们实验室现在把当年交过的所有提交记录做成内部台账包含Bioproject、BioSample、SRA、对应文章、公开日期日常管理方便很多。如果你提交的数据量很大比如一个项目有好几百个样本NCBI还支持通过Programmatic access或者C toolkit批量提交SRA metadata和文件这属于进阶玩法要写简单的XML文件但对规模化提交真的很省力。我打算后面专门写一篇关于大规模批量提交的实践思路如果大家有批量上传方面的需求可以先在NCBI的SRA Submission Portal里把样本信息和FASTQ传到一半然后联系NCBI技术支持请求Bulk FTP账户流程会顺畅不少。
返回列表