ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Nature Microbiology|不依赖系统发育的机器学习框架从基因组预测菌株水平噬菌体—宿主互作

Nature Microbiology|不依赖系统发育的机器学习框架从基因组预测菌株水平噬菌体—宿主互作 摘要噬菌体bacteriophagephage为耐药菌感染治疗与微生物组工程提供了有前景的抗生素替代方案但其应用受限于“如何为特定细菌菌株筛选感染性噬菌体”这一难题。作者提出一种**不依赖系统发育phylogeny-agnostic的机器学习框架仅依据基因组序列即可跨多个细菌属预测菌株水平噬菌体—宿主互作phage-host interactionPHI。在 6 个数据集、949 个细菌菌株、518 个噬菌体、115,037 条互作关系上系统优化超过 1320 万次训练运行后该框架达到与物种特异性方法相当的性能AUROC 0.67–0.94同时消除系统发育约束。对 1240 条预测的大肠杆菌Escherichia coli噬菌体—宿主互作进行实验验证确认其可泛化AUROC 0.84全基因组随机条形码转座子位点测序random barcode transposon-site sequencingRB-TnSeq**显示68.6% 的实验鉴定感染介质被计算模型捕获。模型引导的噬菌体鸡尾酒phage cocktail设计用 5 个噬菌体即可覆盖多达 97.5% 的细菌菌株单噬菌体选择较“广宿主范围promiscuity”策略提升至多 3.1 倍。该平台支持理性噬菌体治疗设计与精准微生物组工程可应用于临床、农业与工业场景。keywords噬菌体—宿主互作菌株水平预测不依赖系统发育蛋白质家族特征CatBoostRB-TnSeq噬菌体鸡尾酒精准微生物组工程文献信息Noonan, A. J. C., Moriniere, L., Rivera-López, E. O., Patel, K., Pena, M., Svab, M., Kazakov, A., Deutschbauer, A., Dudley, E. G., Mutalik, V. K., Arkin, A. P. (2026). Phylogeny-agnostic strain-level prediction of phage-host interactions from genomes using machine learning.Nature Microbiology. https://doi.org/10.1038/s41564-026-02482-5期刊Nature MicrobiologyIF18.1发表时间2026 年 9 月 29 日研究总结噬菌体宿主预测框架问题菌株级互作难预测系统发育约束强阳性样本不平衡数据6个数据集949菌株518噬菌体115037条互作方法蛋白质家族特征MMSeqs2聚类CatBoost分类RFE特征选择验证1240条Ecoli互作RB-TnSeq介质鸡尾酒覆盖97点5_percent意义理性噬菌体治疗精准微生物组工程跨属可扩展背景介绍噬菌体宿主特异性是“进化军备竞赛”的产物噬菌体持续响应宿主受体、细胞壁结构与防御系统的变化。这种菌株级识别可用于靶向单个病原菌同时减少对有益共生菌的附带损伤因而在抗生素耐药背景下极具价值。然而随着噬菌体库规模扩大针对新病原体逐株实验测定敏感性变得不可行。既有工具多停留在科/属级宏基因组宿主分类或依赖已知受体机制做单属模型无法在不预设遗传决定因子的情况下预测“未知菌株 × 未知噬菌体”。单菌株预测需要一对一确认感染成败的数据集且通常高度不平衡阳性互作仅占 2%–36%。作者因此主张跨系统发育、跨实验室数据联合建模才能提高统计功效并捕捉共同感染机制。本文目标即是构建仅用基因组、不依赖系统发育、可解释、可指导鸡尾酒设计的 PHI 预测工作流。重要结果跨细菌属的多样噬菌体—宿主互作汇编与建模工作流作者整合 6 个已发表数据集共 115,037 条互作、949 个细菌菌株、518 个噬菌体。工作流先将蛋白质和氨基酸 k-mer 转为存在—缺失特征用 MMSeqs2 以 40% 序列同一性、80% 覆盖度聚类蛋白质家族再用递归特征消除recursive feature eliminationRFE筛选稳定特征最后以CatBoost梯度提升决策树配合按噬菌体加权的类别权重处理不平衡。该流程在高位稀疏、类别不平衡与高维特征表下保持稳健并可把新基因组通过相似搜索映射到参考蛋白质簇实现未知菌株/噬菌体推理。Fig. 1 | a 从基因组到数值特征再经机器学习预测 PHI 的总体工作流b 特征表示策略蛋白质家族、k-mer、混合表示c 用 MMSeqs2 构建蛋白质家族存在—缺失矩阵d 以 CatBoost 做菌株水平二分类并按噬菌体正/负样本比加权e 新基因组通过相似搜索分配特征后预测未知互作。Created in BioRender: Noonan, A.跨属菌株水平预测达到与物种特异性模型相当的性能在“预测未知细菌菌株”配置下蛋白质家族、较长 k-mer 与混合表示性能无显著差异仅 k3 在 4 个数据集中 3 个最差。作者选蛋白质家族表示以兼顾性能、成本与可解释性。各数据集 AUROC 为 0.67–0.94Matthews 相关系数MCC为 0.13–0.54归一化精确率—召回率面积normalized AUPR为 0.07–0.60。大肠杆菌模型 AUROC 0.87与原 E. coli 专用方法AUROC 0.86接近但本文方法不依赖已知 E. coli 感染介质。数据集越大性能越好AUROC 与样本量 Pearson r0.60MCC r0.47均 P1×10⁻⁶。Figure 2. a 不同基因组表示策略的 AUROCk3 最差其余无显著差b 五个开发数据集的 AUROC、MCC、normalized AUPRc 数据集规模与性能正相关AUROC r0.595MCC r0.467BH 校正后显著d 合并两个 Klebsiella 数据集较单数据集 MCC 提升 0.04–0.07。虚线表示随机预测 AUROC0.5。模型引导的噬菌体鸡尾酒设计优于广宿主策略作者将连续概率转为可执行选择先按互作谱将噬菌体无监督聚为“活性组activity groups”再跨簇选预测概率最高的噬菌体以兼顾预测感染概率与机制多样性。在 20 折交叉验证中模型引导的 1/3/5 个噬菌体鸡尾酒在 E. coli、Klebsiella-2、Vibrionaceae 三个最大数据集上均优于“选最广宿主噬菌体”的基线。单噬菌体选择分别覆盖 66.9%、66.7%、39.4% 菌株相对广宿主基线提升 1.1、3.1、2.7 倍5 噬菌体鸡尾酒覆盖 97.5%、87.8%、57.5% 菌株。Figure 3. a 模型概率 → 噬菌体聚类 → 跨簇选代表噬菌体b 预测概率排序与广宿主排序对比模型选中噬菌体以黑色粗边框标出c 在三大高表现数据集中模型引导鸡尾酒对 1/3/5 个噬菌体的菌株覆盖率均高于 promiscuity-based cocktail。Panel a created in BioRender: Noonan, A.对未知噬菌体的实验验证与 RB-TnSeq 介质确认为验证泛化能力作者用 52 个未参与训练的 BASEL 集合噬菌体点种 25 个 E. coli ECOR 菌株得到 1300 条互作其中 60 条表型不清被剔除剩余 1240 条中模型 AUROC 为 0.84略低于交叉验证的 0.87但证明框架可迁移到不同实验室、不同_protocol 的新噬菌体。随后在 E. coli ECOR27 中做全基因组 RB-TnSeq用 19 个噬菌体筛选 3804 个基因敲除库鉴定出 51 个高得分感染相关基因。通过基因邻域与 STRING 蛋白关联库比对35 个预测特征与 RB-TnSeq 命中基因相连占遗传验证介质的 68.6%直接匹配较随机高 5.0 倍邻域/STRING 扩展集高 3.0 倍。Figure 4. a 52 新噬菌体 × 25 E. coli 菌株的点种矩阵b 1240 条实验表型 vs 预测概率AUROC0.84c SHAP 特征重要性显示预测特征与 RB-TnSeq 命中基因的关系深棕直接匹配中棕邻域匹配浅棕STRING-DB 匹配右图为 goaGpuuE与 gabT 的 STRING 网络及 ybdK 邻接共线性图。预测特征可恢复已知与未知感染决定因子用 SHAP 值量化特征方向存在某蛋白质家族若提高感染概率即为正向特征降低则为负向特征。在 E. coli 数据集中前 25 个最重要特征涵盖细胞壁生物合成、可移动遗传元件mobile genetic elementsMGEs、限制修饰restriction-modificationRM系统、病毒来源基因其中 8 个无清晰机制注释可能为未表征介质。防御系统通常负向、抗防御系统通常正向。STRING 与邻域分析进一步提示腐胺分解代谢、已知受体 lepA 的调控参与感染说明模型常捕获“通路/操纵子级调控”而非单基因效应。Figure 5. a E. coli 前 25 预测特征的功能分类与 SHAP 方向细胞壁、MGE、RM、病毒源、未知b goaG/puuE 与 gabT 的 STRING 蛋白关联网络c lepA 与预测特征 ybdK 在 3 个含 ybdK 菌株与 3 个不含菌株中的共线性图。方法学参考收集已发表PHI矩阵与基因组核心基因组建树与系统发育距离MMSeqs2聚类蛋白质家族或k-mer表示RFE筛选稳定特征CatBoost按噬菌体类权重训练菌株/噬菌体/全新生境三种交叉验证SHAP解释与RB-TnSeq验证按互作谱聚类噬菌体设计鸡尾酒点种与EOP实验外部验证可复用要点包括用蛋白质家族存在—缺失代替手工受体注释以实现跨属泛化以按噬菌体加权的 CatBoost 处理极端不平衡RFE 跨多轮训练跟踪特征出现频率以防过拟合用 RB-TnSeq/DubSeq/CRISPRi 等遗传筛选作为“生物学真值”校验机器学习特征鸡尾酒设计先聚类机制再跨簇选代表而非只追广宿主噬菌体。总结该研究的核心贡献是把菌株水平 PHI 预测从“属内、已知受体、单实验室”推进到“跨属、无系统发育预设、可外部实验验证”的框架。作者证明在高位稀疏基因组特征下算法与特征选择策略比“换一种基因组表示”更重要大模型性能受阳性样本量与平衡度限制但跨团队 Klebsiella 数据集合并可带来切实提升。实验上1240 条新互作与 RB-TnSeq 共同说明模型捕获的不只是相关噪声而是部分真实感染介质包括调控基因与未注释因子。局限同样明确跨属留一预测接近随机说明蛋白质家族特征难以跨越极远进化距离RB-TnSeq 只能验证非必需基因必需基因需 CRISPRi 等补充不同数据集固体/液体培养与阈值不统一会限制联合训练。未来若引入蛋白语言模型嵌入、环境条件和主动学习可进一步提升跨属迁移与临床噬菌体鸡尾酒设计效率。参考文献Noonan, A. J. C., Moriniere, L., Rivera-López, E. O., Patel, K., Pena, M., Svab, M., Kazakov, A., Deutschbauer, A., Dudley, E. G., Mutalik, V. K., Arkin, A. P. (2026). Phylogeny-agnostic strain-level prediction of phage-host interactions from genomes using machine learning.Nature Microbiology. https://doi.org/10.1038/s41564-026-02482-5Gaborieau, B. et al. Prediction of strain level phage-host interactions across the Escherichia genus using only genomic information.Nature Microbiology(2024).Mutalik, V. K. et al. High-throughput mapping of the phage resistance landscape in E. coli.PLoS Biology18, e3000877 (2020).GenoPHI 代码库https://github.com/Noonanav/GenoPHIZenodo 数据https://doi.org/10.5281/zenodo.21696332MMSeqs2https://github.com/soedinglab/MMseqs2CatBoosthttps://catboost.aiRB-TnSeq 方法Wetmore, K. M. et al., mBio 6, e00306-15 (2015)
返回列表