picard标记DI/DS标签
发布时间:2026/7/27 1:03:10
代码示例
java -jar /mnt/zmds01/Product/bioinfo/gitlab/biobase/bin/picard.jar MarkDuplicates \ I="input.sort.bam" \ O="out_marked_dup.bam" \ M="out_dup_mertrics.txt" \ AS=true \ MAX_FILE_HANDLES_FOR_READ_ENDS_MAP=1000 \ TAGGING_POLICY=All \ CREATE_INDEX=true
代码详解
一、命令结构与核心功能
java -jar [Picard工具路径] MarkDuplicates \[输入参数] \[输出参数] \[可选配置参数]
核心功能:识别并标记高通量测序数据中因 PCR 扩增或测序仪重复读取产生的重复序列,为后续分析(如变异检测、定量分析)排除技术重复干扰。
二、参数详解
1. 基础调用部分
-
java -jarPicard 是 Java 编写的工具,需通过 Java 虚拟机运行,-jar指定执行的 jar 包文件。 -
/mnt/zmds01/Product/bioinfo/gitlab/biobase/bin/picard.jarPicard 工具的安装路径,包含所有功能模块(此处调用MarkDuplicates模块)。 -
MarkDuplicates要执行的具体功能模块,用于识别和标记重复序列。
2. 输入输出参数(必填)
-
I="/path/to/input.sort.bam"I:Input的缩写,指定输入的 BAM 文件路径。- 要求:输入文件必须是按坐标排序的比对文件(文件名中的
.sort.bam表明已排序),这是工具准确判断重复序列的前提。
-
O="/path/to/output_marked_dup.bam"O:Output的缩写,指定输出的 BAM 文件路径,包含标记重复后的结果。- 特点:输出文件中,重复序列会被添加
0x400(十进制 1024)的标记(SAM 格式的第 2 字段),同时保留所有原始序列信息。
-
M="/path/to/dup_metrics.txt"M:Metrics的缩写,指定输出的重复率统计文件路径。- 内容:包含总 reads 数、重复 reads 数、重复率、文库复杂度等关键指标(示例如下):
## METRICS CLASS picard.sam.markduplicates.MarkDuplicatesMetrics LIBRARY UNPAIRED_READS_EXAMINED READ_PAIRS_EXAMINED UNMAPPED_READS ... ESTIMATED_LIBRARY_SIZE None 12345 67890 123 ... 543210
3. 可选配置参数(功能优化)
-
AS=trueAS:ASSUME_SORTED的缩写,设置为true表示 “假设输入文件已按坐标排序”。- 作用:跳过工具内部的排序检查步骤,加快运行速度(若输入文件未正确排序,会导致结果错误,需确保
sort.bam确实已排序)。
-
MAX_FILE_HANDLES_FOR_READ_ENDS_MAP=1000- 限制工具运行时打开的文件句柄数量(Linux 系统对进程打开文件数有默认限制)。
- 作用:避免处理大文件时因 “打开文件过多” 导致的报错,1000 是一个安全的高值设置。
-
TAGGING_POLICY=All- 控制重复序列标签(
DI和DS)的添加范围:- 默认值为
DUPLEX或SINGLE,仅对重复序列添加标签; - 设置为
All时,所有序列(包括非重复的 “代表序列”)都会被添加标签:DI(Duplicate Set Index):重复组唯一 ID(同一原始片段的扩增产物共享相同DI);DS(Duplicate Set Size):该重复组包含的总序列数。
- 默认值为
- 重要性:您的分析脚本依赖
DI标签进行重复组分组,此参数确保所有序列都能被正确分组。
- 控制重复序列标签(
-
CREATE_INDEX=true- 自动为输出的 BAM 文件生成索引(
.bai文件)。 - 作用:索引文件允许后续工具(如
samtools、IGV 基因组浏览器)快速定位特定区域的序列,无需读取整个 BAM 文件,提升分析效率。
- 自动为输出的 BAM 文件生成索引(
三、运行逻辑与输出结果
-
运行流程:① 读取输入的排序 BAM 文件,解析每条序列的比对位置(染色体、起始坐标)和序列特征;② 基于位置和序列一致性判断重复组(来自同一原始 DNA 片段的扩增产物);③ 为每个重复组添加
DI(组 ID)和DS(组大小)标签,并标记重复序列(0x400标志);④ 输出标记后的 BAM 文件、索引文件和重复率统计文件。 -
关键输出文件:
out_marked_dup.bam:标记重复后的主文件,包含所有序列及DI/DS标签;out_marked_dup.bai:BAM 索引文件(由CREATE_INDEX=true生成);out_dup_mertrics.txt:重复率统计,用于评估数据质量(如重复率过高可能提示 PCR 扩增偏差)。
四、使用注意事项
- 输入文件必须按坐标排序(可通过
samtools view -H input.bam | grep @HD查看SO:coordinate确认); TAGGING_POLICY=All是您后续分析(基于DI标签分组)的关键参数,不可省略;- 若运行时报 “文件句柄不足” 错误,可增大
MAX_FILE_HANDLES_FOR_READ_ENDS_MAP的值(如 2000); - 结果可通过
samtools view output.bam | head查看,重复序列的第 2 字段会包含1024(0x400的十进制),且所有序列都有DI:i:xxx标签。
相关新闻
2026/7/19 7:33:10
2025 年南昌装修公司推荐南昌市宿然装饰工程有限公司,以专业与真诚雕琢理想空间南昌装修设计推荐指南!
2026/7/26 3:10:17
2025 年国内模切加工源头厂家最新推荐排行榜:聚焦 0.1mm 精度与高产能标杆,为下游企业精选优质合作商电子辅料/硅胶/薄膜/胶黏/绝缘模切加工厂家推荐
2026/7/17 10:56:19
直播协议详解 RTMP、HLS、HTTP-FLV、WebRTC、RTSP 的区别
2026/7/27 10:17:55
深圳南山区屋顶漏水维修|粤港澳大湾区台风盐雾防水堵漏,2026 广东正规防水补漏方案 - 速递信息
2026/7/27 10:17:18
终极无损视频剪辑指南:如何用LosslessCut实现零画质损失编辑
2026/7/27 10:15:28
江门蓬江区屋顶漏水维修|粤西侨乡台风防潮防水堵漏,2026 广东正规防水补漏方案 - 速递信息
2026/7/27 10:15:28
终极虚幻引擎存档编辑指南:3分钟掌握uesave完整使用技巧
2026/7/27 10:15:28
怎么买高铁票比较便宜?学会这几招,每次出行都能省下不少钱 - 工具软件使用方法推荐
2026/7/27 10:15:28
移动应用终极防护:PiliPlus级代码混淆与加固实战指南
2026/7/27 0:16:44
技术焦虑下的业务聚焦:构建可持续的技术竞争力
2026/7/27 8:51:27
仅限本周开放|GMAT AI备考效能评估工具(含ETS官方题库行为轨迹比对模块),免费生成专属「提分热力图」与瓶颈突破路线图
2026/7/27 2:05:53
AI时代SEO新标配:Schema结构化数据与llms.txt实战指南
2026/7/27 0:01:04
基于YOLOv13的建筑病害智能检测系统开发与实践
2026/7/27 0:01:47
从经典QSAR到AI药物设计:分子描述符的演进与应用
2026/7/27 0:01:47
2026年7月江苏省无锡市电信500M单宽带怎么安装? - 找卡家园
2026/7/26 12:35:22
[C++]内存管理:串顺序存储的内存回收
2026/7/26 12:35:41
足球口袋教练 HarmonyOS 离线应用实战(03/20):ArkUI 首页仪表盘搭建
2026/7/26 19:42:19