ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

PP-HelixFold 推理资源准备指南:预训练模型参数与 MSA/模板数据库下载全解析

PP-HelixFold 推理资源准备指南:预训练模型参数与 MSA/模板数据库下载全解析 人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载PP-HelixFold 是基于 PaddlePaddle 在 GPU 与 DCU 上完整复现 AlphaFold2 训练与推理流程的蛋白质结构预测模型运行其推理流程前必须准备好 AlphaFold2 预训练模型参数和多序列比对MSA、模板搜索所需的系列数据库。本文以 modelcenter/PP-HelixFold/download_cn.md 的下载清单为骨架逐项说明每份资源的功能定位、磁盘占用、与推理命令参数的对应关系并结合仓库内的 环境与推理说明、推理 Benchmark 及 在线 Demo 应用完整覆盖从数据下载、环境安装到单卡/多卡推理与 CASP14 Demo 验证的全流程。一、下载资源总览一份模型参数 七份数据库PP-HelixFold 推理依赖两类外部资源一是 AlphaFold2 官方预训练模型参数约 93 MB二是七份用于 MSA 搜索与模板搜索的数据库。完整版数据库与模型参数解压前总大小约 415 GB解压后约 2.2 TB请提前评估磁盘与网络带宽。1.1 预训练模型参数模型名称模型简介模型参数大小下载地址AlphaFold2_parameters蛋白质结构预测~ 93Mhttps://storage.googleapis.com/alphafold/alphafold_params_2021-10-27.tar该压缩包由 DeepMind 提供包含 AlphaFold2 论文中使用的多套模型参数如model_5推理时通过--model_names参数指定使用哪一套。1.2 数据库清单数据库名称功能简介数据库大小下载地址bfdMSA搜索~ 1.7 TB (解压前: 271.6 GB)https://storage.googleapis.com/alphafold-databases/casp14_versions/bfd_metaclust_clu_complete_id30_c90_final_seq.sorted_opt.tar.gzsmall_bfdMSA搜索~ 17 GB (解压前: 9.6 GB)https://storage.googleapis.com/alphafold-databases/reduced_dbs/bfd-first_non_consensus_sequences.fasta.gzmgnifyMSA搜索~ 64 GB (解压前: 32.9 GB)https://storage.googleapis.com/alphafold-databases/casp14_versions/mgy_clusters_2018_12.fa.gzuniclust30MSA搜索~ 86 GB (解压前: 24.9 GB)https://storage.googleapis.com/alphafold-databases/casp14_versions/uniclust30_2018_08_hhsuite.tar.gzuniref90MSA搜索~ 58 GB (解压前: 29.7 GB)ftp://ftp.uniprot.org/pub/databases/uniprot/uniref/uniref90/uniref90.fasta.gzpdb70模板搜索~ 56 GB (解压前: 19.5 GB)http://wwwuser.gwdg.de/~compbiol/data/hhsuite/databases/hhsuite_dbs/old-releases/pdb70_from_mmcif_200401.tar.gzpdb_mmcif模板搜索~ 206 GB (解压前: 46 GB)rsync.rcsb.org::ftp_data/structures/divided/mmCIF/磁盘规划要点表中数据库大小为解压后占用下载体积见解压前列。以 bfd 为例下载约 271.6 GB解压后膨胀至约 1.7 TB是全部资源中体量最大的部分。若磁盘空间有限或仅做功能验证可使用下文介绍的精简版reduced_dbs方案将总占用从约 2.2 TB 降至约 530 GB。二、按功能拆分MSA 搜索库与模板搜索库分别起什么作用从用途上可将七份数据库分为两组它们对应run_helixfold.py推理脚本中不同的命令行参数完整命令见下文第四节。2.1 MSA 搜索数据库5 份蛋白质结构预测的第一步是构建目标序列的多序列比对MSA。PP-HelixFold 使用jackhmmer、hhblits等工具在不同数据库上执行搜索数据库用途对应推理参数bfd大型序列库完整版 MSA 搜索的主力数据库--bfd_database_pathsmall_bfdbfd 的精简子集reduced_dbs模式下的替代品--small_bfd_database_pathmgnify宏基因组序列库补充进化信息--mgnify_database_pathuniclust30去冗余蛋白序列库HH-suite 格式--uniclust30_database_pathuniref90UniRef90 去冗余蛋白序列库--uniref90_database_path2.2 模板搜索数据库2 份除 MSA 外AlphaFold2 还依赖同源模板结构作为折叠约束由hhsearch在 PDB 结构库上检索数据库用途对应推理参数pdb70由 PDB 结构聚类出的 70% 相似度模板库HH-suite 格式--pdb70_database_pathpdb_mmcif完整 PDB 结构库mmCIF 格式提供模板原子坐标--template_mmcif_dir与--obsolete_pdbs_path注意 pdb_mmcif 比较特殊它通过 rsync 从 RCSB 镜像同步解压后的mmcif_files目录用于--template_mmcif_dir同目录下需放置obsolete.dat已废弃条目列表供--obsolete_pdbs_path使用。这是所有资源中唯一不通过 HTTP/FTP 单文件下载、而需要 rsync 同步的数据集。三、下载方式一键脚本download_all_data.sh与 模型使用说明 一致官方推荐运行scripts/download_all_data.sh脚本完成全部资源下载脚本依赖aria2c加速下载。该脚本支持两个选项3.1 默认选项完整版数据库scripts/download_all_data.sh DOWNLOAD_DIR下载并解压上文全部七份数据库与预训练模型参数解压前总大小约 415 GB解压后约 2.2 TB。适合追求 AlphaFold2 原始精度、磁盘和带宽充裕的场景。3.2reduced_dbs选项精简版数据库scripts/download_all_data.sh DOWNLOAD_DIR reduced_dbs仅下载small_bfd等精简版 MSA 数据库跳过大型 bfd解压前总大小约 190 GB解压后约 530 GB。适合快速验证流程、显存/磁盘受限的场景推理时需在run_helixfold.py中设置--presetreduced_dbs详见下节命令。3.3 手动核对目录结构无论使用哪种选项下载完成后应形成如下目录结构以便与推理参数一一对应DOWNLOAD_DIR/ ├── params/ # AlphaFold2 预训练模型参数--model_names 使用 ├── bfd/bfd_metaclust_clu_complete_id30_c90_final_seq.sorted_opt ├── small_bfd/bfd-first_non_consensus_sequences.fasta ├── mgnify/mgy_clusters_2018_12.fa ├── uniclust30/uniclust30_2018_08/uniclust30_2018_08 ├── uniref90/uniref90.fasta ├── pdb70/pdb70 └── pdb_mmcif/ ├── mmcif_files/ # --template_mmcif_dir └── obsolete.dat # --obsolete_pdbs_path若某个数据库下载中断可单独重新执行对应资源的下载与解压命令各资源下载地址见第一节表格无需重跑全部。四、下载之后环境准备与推理命令对接资源就绪后即可进入推理环节。以下环境与命令均取自仓库内的 PP-HelixFold 使用说明。4.1 环境需求仓库明确记录的复现环境为Python: 3.7CUDA: 11.2CUDNN: 8.10.1NCCL: 2.12.12安装要点paddlepaddle通过 pip 安装需匹配 CUDA 版本的 GPU dev 包openmm7.5.1与pdbfixer仅可通过 conda 安装MSA 搜索与模板搜索依赖kalign、HH-suite提供hhblits、hhsearch、jackhmmer等外部工具下载脚本需要支持aria2c若要开启 DAP/BP/DP-DAP-BP 混合并行模式还需安装ppfleetxPaddleFleetX release/2.4 分支python setup.py develop。4.2 单卡推理DP 模式fasta_filetarget.fasta # path to the target protein model_namemodel_5 # the alphafold model name DATA_DIRdata # path to the databases OUTPUT_DIRhelixfold_output # path to save the outputs python run_helixfold.py \ --fasta_paths${fasta_file} \ --data_dir${DATA_DIR} \ --bfd_database_path${DATA_DIR}/bfd/bfd_metaclust_clu_complete_id30_c90_final_seq.sorted_opt \ --small_bfd_database_path${DATA_DIR}/small_bfd/bfd-first_non_consensus_sequences.fasta \ --uniclust30_database_path${DATA_DIR}/uniclust30/uniclust30_2018_08/uniclust30_2018_08 \ --uniref90_database_path${DATA_DIR}/uniref90/uniref90.fasta \ --mgnify_database_path${DATA_DIR}/mgnify/mgy_clusters_2018_12.fa \ --pdb70_database_path${DATA_DIR}/pdb70/pdb70 \ --template_mmcif_dir${DATA_DIR}/pdb_mmcif/mmcif_files \ --obsolete_pdbs_path${DATA_DIR}/pdb_mmcif/obsolete.dat \ --max_template_date2020-05-14 \ --model_names${model_name} \ --output_dir${OUTPUT_DIR} \ --presetreduced_dbs \ --jackhmmer_binary_path /opt/conda/envs/helixfold/bin/jackhmmer \ --hhblits_binary_path /opt/conda/envs/helixfold/bin/hhblits \ --hhsearch_binary_path /opt/conda/envs/helixfold/bin/hhsearch \ --kalign_binary_path /opt/conda/envs/helixfold/bin/kalign \ --random_seed0每条--xxx_database_path均指向第一节表格中对应数据库解压后的文件路径--preset需与下载时选择的reduced_dbs/ 完整版保持一致。--jackhmmer_binary_path等四个参数指向已安装外部工具的实际路径。4.3 多卡推理DAP 模式fasta_filetarget.fasta # path to the target protein model_namemodel_5 # the alphafold model name DATA_DIRdata # path to the databases OUTPUT_DIRhelixfold_output # path to save the outputs log_dirdemo_log # path to log file distributed_args--run_modecollective --log_dir${log_dir} python -m paddle.distributed.launch ${distributed_args} \ --gpus0,1,2,3,4,5,6,7 \ run_helixfold.py \ --distributed \ --dap_degree 8 \ --fasta_paths${fasta_file} \ --data_dir${DATA_DIR} \ --bfd_database_path${DATA_DIR}/bfd/bfd_metaclust_clu_complete_id30_c90_final_seq.sorted_opt \ --small_bfd_database_path${DATA_DIR}/small_bfd/bfd-first_non_consensus_sequences.fasta \ --uniclust30_database_path${DATA_DIR}/uniclust30/uniclust30_2018_08/uniclust30_2018_08 \ --uniref90_database_path${DATA_DIR}/uniref90/uniref90.fasta \ --mgnify_database_path${DATA_DIR}/mgnify/mgy_clusters_2018_12.fa \ --pdb70_database_path${DATA_DIR}/pdb70/pdb70 \ --template_mmcif_dir${DATA_DIR}/pdb_mmcif/mmcif_files \ --obsolete_pdbs_path${DATA_DIR}/pdb_mmcif/obsolete.dat \ --max_template_date2020-05-14 \ --model_names${model_name} \ --output_dir${OUTPUT_DIR} \ --presetreduced_dbs \ --seed 2022 \ --jackhmmer_binary_path /opt/conda/envs/helixfold/bin/jackhmmer \ --hhblits_binary_path /opt/conda/envs/helixfold/bin/hhblits \ --hhsearch_binary_path /opt/conda/envs/helixfold/bin/hhsearch \ --kalign_binary_path /opt/conda/envs/helixfold/bin/kalign \ --random_seed0多卡模式通过--distributed --dap_degree 8开启 8 卡动态轴并行Dynamic Axial Parallelism数据库中 MSA 的序列维度可沿各卡切分并行计算。python run_helixfold.py -h可查看全部参数定义。五、不下载数据库的快速验证CASP14 Demo若只想快速验证 PP-HelixFold 推理链路仓库提供了免数据库方案运行 APP 目录 中附带的 CASP14 示例蛋白T1026与T1037只需下载约 93 MB 的预训练模型参数即可无需任何数据库。sh gpu_infer.sh T1026其中T1026.fasta含 172 个残基与T1037.fasta为输入序列仓库同时提供了对应预测结果T1026_pred.pdb、T1037_pred.pdb标准 PDB 格式含 ATOM 记录与每残基坐标可用于对照验证预测输出格式。六、在线服务与本地可视化仓库内还提供了基于 Gradio 的 在线 Demo 应用配置见 app.yml依赖见 requirements.txt。运行后可在浏览器中选择示例蛋白并触发预测结果通过 3Dmol.js 以卡通模型spectrum 配色在页面内直接渲染也可输入 RCSB PDB 编号自动抓取.pdb文件进行可视化。适合在下载与推理完成后对_pred.pdb输出做直观检查。七、精度与性能背景数据来源仓库 Benchmark根据仓库 benchmark_cn.mdPP-HelixFold 在 NVIDIA A100 (40G) 单卡、batch size 为 1 的环境下完成推理测试训练数据 25% 来自 RCSB PDB、75% 来自自蒸馏数据集测试集包含 87 个 CASP14 结构域蛋白与 371 个 CAMEO 蛋白。报告中 TM-score 指标分别达到 0.8771CASP14与 0.8885CAMEO且训练耗时较原版 AlphaFold2 显著缩短。这些结论均来自仓库文档陈述如需复现请严格对齐上文列出的软件环境。八、许可与引用PP-HelixFold 代码遵循 Apache 2.0 License与 AlphaFold2 相同但 DeepMind 提供的 AlphaFold2 预训练模型参数遵循 CC BY-NC 4.0仅可用于非商业用途商用前务必确认合规边界数据库资源bfd、uniref90、PDB 等版权归属各自提供方使用请遵循对应数据库的使用条款。若在论文或产品中使用了相关代码与数据可参照 introduction_cn.ipynb 中提供的 BibTeX 引用 AlphaFold2 论文、HelixFold 论文及并行 Evoformer 训练论文。小结本文以 download_cn.md 的下载清单为核心将模型参数 七份数据库的每一项都落实到功能定位、磁盘占用与run_helixfold.py参数上并串联起一键下载脚本、环境安装、单卡/多卡推理与免数据库 Demo 的完整链路。实际落地时建议先按第四节环境清单安装依赖再按第三节脚本下载资源最后以第五节T1026Demo 验证环境无误后再投入完整数据库的正式推理。赞分享人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载相关推荐scikit-learn set_output API 实战让 Transformer 直接输出 Pandas / Polars DataFramescikit learn set_output API 实战让 Transformer 直接输出 Pandas / Polars DataFrame 导读 本人工智能深度学习计算机视觉NLP语音量化配置详解理解MiniMax-M3-MXFP4-AttnFP8中的层量化策略与排除规则量化配置详解理解MiniMax M3 MXFP4 AttnFP8中的层量化策略与排除规则 MiniMax M3 MXFP4 AttnFP8是一款针对AMD平台基础模型大模型多模态模型量化模型推理服务LoFTR项目训练指南从数据准备到模型训练全解析LoFTR项目训练指南从数据准备到模型训练全解析 前言 LoFTR作为一种基于局部特征变换的深度学习模型在图像匹配领域展现了卓越的性能。本文将全面介绍LoF人工智能计算机视觉深度学习图像处理上一篇3步跑通escrcpy投屏控制从首次设备镜像到多设备管理下一篇OPSX 归档命令深度解析openspec 实验性工作流的变更归档机制创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表