ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AlphaFold 蛋白结构预测完整指南:4 步从零跑通,附质量判断方法

AlphaFold 蛋白结构预测完整指南:4 步从零跑通,附质量判断方法 AlphaFold 蛋白结构预测完整指南4 步从零跑通附质量判断方法【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold如果你手头只有一段氨基酸序列却想知道它折叠成什么形状AlphaFold 蛋白结构预测能直接给出答案这个仓库是 DeepMind 开源的 AlphaFold 2 推理管线Apache 2.0 协议输入 FASTA 序列输出带置信度标注的三维结构文件同时支持 AlphaFold-Multimer 多聚体模式来预测蛋白质复合物的组装形态。它解决了什么痛点凭什么可信实验手段获取蛋白结构一直不便宜X 射线晶体学要养晶体冷冻电镜要排队机时周期从几个月到一两年不等。AlphaFold 把这件事变成了一次 GPU 计算——输入序列几十分钟拿到预测结构并且每个残基都自带置信度分数。它不是看起来不错的工具在 2020 年 CASP14 结构预测大赛中其对真实靶点的预测精度已接近实验分辨率。下图左绿色、右蓝色分别代表实验结构和 AlphaFold 的预测两者几乎重合GDT 分数超过 90满分 100这个仓库除了单链monomer预测还提供AlphaFold-Multimer多链复合物的联合建模v2.3.0 版权重对大型复合物训练时最多 20 条链有明显提升详见v2.3.0 技术笔记CASP15 基线预测集附人工干预说明可用于复现与校验简化版 Colab 笔记本notebooks/AlphaFold.ipynb不用本机搭环境也能体验硬件与数据预算动手前先算清 3 笔账AlphaFold 只支持 Linux官方路径是 Docker 容器 NVIDIA GPU显存越大能预测的蛋白越长。在开始下载之前先看这 3 个数字项目完整配置精简配置reduced_dbs数据库下载量约 556 GB明显更小解压后磁盘占用约 2.62 TB约 600 GB硬件底线高速 SSD 强烈建议8 核 CPU / 8 GB 内存精简配置通过--db_presetreduced_dbs启用用的是小版 BFD 数据库适合先跑通流程、硬件一般的用户数据库需要 UniRef90、UniRef30、BFD或小 BFD、MGnify、PDB mmCIF、PDB70单链用、UniProt 与 PDB SeqRes多聚体用等scripts/ 目录下每个数据库都有对应下载脚本预测耗时大致参考A100 单卡不含 MSA 搜索300 残基约 13 秒1000 残基约 96 秒2000 残基约 450 秒5000 残基则接近 5 小时首次预测的 4 个步骤环境、数据、镜像、运行命令第 1 步装好 Docker 与 NVIDIA Container Toolkit并让当前用户免 root 运行 Docker官方 README 里有完整步骤见官方 README。装完可用docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi验证容器能看到 GPU。第 2 步下载数据库。安装aria2c后运行下载脚本耗时较长建议后台执行# 完整数据库加 reduced_dbs 参数则为精简版 scripts/download_all_data.sh DOWNLOAD_DIR # 构建 Docker 镜像 docker build -f docker/Dockerfile -t alphafold .两个关键提醒DOWNLOAD_DIR不要放在仓库目录内部否则构建镜像时大数据库会被复制进 Docker 构建上下文慢到无法接受下载目录需保证读写权限chmod 755 -R否则 MSA 工具会抛出莫名其妙的报错。第 3 步准备输入 FASTA。单链就一条序列多聚体则把每条链的序列都写进去链名 序列换行分隔。注意FASTA 里写了几条序列模型就按几个亚基来组装这就是复合物的化学计量比。第 4 步运行预测。装好docker/requirements.txt的依赖后python3 docker/run_docker.py \ --fasta_pathsyour_protein.fasta \ --max_template_date2022-01-01 \ --data_dir$DOWNLOAD_DIR \ --output_dir/绝对路径/输出目录--max_template_date限制模板结构的最晚发布日期避免泄漏到目标结构之后才公布的模板--output_dir必须是可写的绝对路径。预测流水线内部发生了什么一次运行大致经历 5 个阶段理解它有助于你定位卡在哪一步MSA多序列比对阶段最耗时也是磁盘与带宽的大头如果后续只改模型参数可用--use_precomputed_msastrue复用已算好的 MSA默认跑 5 个模型、取置信度最高者这种多模型投票能压制单个随机种子的波动排序完成后--models_to_relax控制弛豫范围best默认只弛豫第一名、all、noneGPU 上弛豫更快但偶尔不稳定CPU 更稳输出目录怎么读ranked_0.pdb、pLDDT 与 PAE运行结束后--output_dir下会按输入文件名建立子目录核心文件如下文件内容ranked_0.pdb置信度最高的预测结构日常主要看它ranked_1~4.pdb依次降低unrelaxed_model_*.pdb/relaxed_model_*.pdb模型原始输出 / Amber 弛豫后的结构result_model_*.pkl每个模型的完整原始输出pLDDT、PAE、ptm 等 NumPy 数组confidence_model_*.json/pae_model_*.json按模型导出的 pLDDT 与 PAE 数值ranking_debug.json各模型排序得分及名次映射features.pkl/msas/输入特征与 MSA 搜索中间产物用于复现与调试timings.json各阶段耗时质量判断看 3 个指标pLDDT0–100越高越可信残基级置信度。PDB 文件里它被写进 B-factor 列——注意与常规 B 因子含义相反这里数值越高越好用它做分子替换时要格外小心。粗略参照90 高置信、70–90 较可信、50–70 中等、50 谨慎使用PAE预测对齐误差越低越好N×N 矩阵描述任意两个残基的相对位置误差。链内对角块低而链间区块偏高说明单链本身可靠、但复合物取向不确定ptm / iptm多聚体模式还会输出整体质量分ranking_debug.json里多聚体的排序依据就是iptmptm单链则用 pLDDT多聚体复合物预测只差两个参数预测复合物的流程与单链完全一致区别仅在于输入 FASTA 写入全部亚基序列并设置--model_presetmultimerpython3 docker/run_docker.py \ --fasta_pathscomplex.fasta \ --model_presetmultimer \ --data_dir$DOWNLOAD_DIR \ --output_dir/绝对路径/输出目录需要心里有数的几点多聚体模式必须额外下载 UniProt 和 PDB SeqRes 数据库且 PDB mmCIF 与 SeqRes 版本要一致模板搜索用默认每个模型跑 5 个随机种子5 个模型共 25 次预测耗时可观--num_multimer_predictions_per_model1可降到每模型 1 次精度略有下降v2.3.0 的多聚体权重在化学计量比已知时普遍优于单链模式包括已知为单体的蛋白但如果亚基数量未知如基因组规模预测单链模式平均反而更准官方声明 AlphaFold-Multimer 仍在迭代中稳定性弱于单链系统解读结果时留一手常见坑与绕过办法磁盘告急2.62 TB 是完整库解压后的体量先规划好独立磁盘小硬盘直接用精简配置MSA 工具报诡异错误九成是数据库目录权限问题补全读写权限即可容器看不到 GPU先跑 README 里的nvidia-smi验证命令容器外能看到、容器内看不到基本是 NVIDIA Container Toolkit 没装对同一条序列两次结果差异大属正常现象个别靶点波动尤其明显官方用 5 模型取最高置信度来缓解重要结果建议固定--random_seed复跑弛豫阶段报错或太慢可先设--models_to_relaxnone拿到原始结构弛豫是改善局部几何、不是提升预测本身⚠️复现 CASP14 结果需要锁定当年的数据库版本仅靠--max_template_date不够详见 README 的复现性说明适用边界与进阶方向用之前明确边界AlphaFold 输出是理论建模结果不用于临床用途它预测的是静态单构象不显式建模配体、小分子或膜环境对无序区域pLDDT 长期 50 的片段不要期望可靠结构。进阶路线大型或困难靶点技术笔记建议把每模型种子数提高到 20、增加 recycle 次数精度更好但耗时同步上升批量预测推理脚本默认按单蛋白编译模型重复跑小蛋白时编译开销占比升高可基于RunModel.predict与make_fixed_size自行搭建批量流水线学习入口官方 README 是总纲docs/technical_note_v2.3.0.md 讲清 v2.3.0 权重更新动机run_alphafold.py 则是容器内主流程源码想看参数如何生效直接读它一段序列到可信的三维模型AlphaFold 把结构生物学的几个月压缩到了几十分钟——把数据库、Docker 和 FASTA 三件事备好你的第一次预测今天就绪。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表