ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

CANN 端云协同:节约开发、运行成本,支撑Mate90发布会鸿蒙独占应用创新

CANN 端云协同:节约开发、运行成本,支撑Mate90发布会鸿蒙独占应用创新 CANN端云协同将云侧研发积累延伸至终端开发。依托昇腾与麒麟NPU同源的达芬奇DaVinci架构以及CANN软件开发能力开发者在昇腾上完成的部分模型适配与算子实现可以继续沿用于麒麟端侧在降低开发投入的同时也有助于降低云侧推理成本。摸小宠将基于昇腾训练的自研模型能力带入了鸿蒙终端。这款由魔芯科技开发的宠物3D重建应用在本次手机发布会上作为鸿蒙独占应用亮相。其MoWorld-2.0模型在昇腾上完成训练经量化与裁剪形成端侧版本再通过算子代码的沿用与针对性适配完成麒麟端侧部署。算子资产与经验的端云协同为模型迁移减少了重复开发工作让云侧研发投入进一步服务于手机产品。01 从昇腾到麒麟延续硬件亲和设计与算子协同减少落端工作量昇腾与麒麟NPU均基于DaVinci架构底层统一采用CANN软件栈这意味着昇腾云侧训练的模型可便捷迁移至麒麟端侧芯片实现“云端一致”的算子开发体验。MoWorld-2.0模型在研发时已将DaVinci硬件的亲和设计纳入其中。这种硬件亲和性的延续使模型研发与终端适配顺畅衔接端侧适配时无需再考虑模型架构是否适合端侧硬件设计。端侧模型虽规格小于云侧但保留了云侧模型的核心计算结构。通过量化与裁剪形成约0.6B的端侧版本模型其核心计算模块及相关算子结构与云侧保持一致面向昇腾的计算设计仍然适用也为底层代码的端云共用创造了条件。算子作为模型执行计算的基本单元其实现的跨设备复用程度直接影响模型端侧部署的复杂度。摸小宠的端侧算子适配直接沿用了云侧训练阶段积累的代码端侧仅需少量适配工作。此次迁移涉及的Vector类算子中约85%的代码可原样保留仅Tile等硬件强相关部分需要面向端侧调整。基于统一的CANN软件栈训练完成的模型只需四步即可部署到麒麟手机Step1 模型量化使用量化工具对模型进行量化压缩降低端侧推理开销。Step2 模型导出基于PyTorch框架配合torchAir插件导出量化后的AIR模型Ascend IR自定义算子随之一并封装其中。Step3 模型转换使用ATC工具对AIR模型进行优化与编译生成可直接部署的离线模型。ATC在转换过程中逐算子编译因此需要提供自定义算子在麒麟侧的实现。得益于麒麟与昇腾统一的Ascend C编程API训练阶段在昇腾上实现的自定义算子可快速迁移至端侧大幅降低适配成本。Step4 推理部署将离线模型打包进鸿蒙HAP包通过调用鸿蒙系统的CANN Kit库即可在端侧完成模型推理。基于此端云协同架构单个算子从云侧迁移到手机从“以月计”变成“以天计”。摸小宠仅用数周时间即完成了自研模型的端侧适配。02 摸小宠端云协同三维重建体验节省计算成本摸小宠致力于把用户相册中的静态宠物照片转化为真实感强、可交互的4D空间资产提供“宠物就在身边”的沉浸式体验。市场上的同类产品缺乏还原真实宠物的能力摸小宠基于自研新一代MoWorld-2.0技术实现了通过用户的1-4张照片就能在云端还原出拟真的用户宠物的4D数字分身。摸小宠基于用户输入的宠物图片在麒麟端侧运行约6亿参数规模的MoWorld-2.0-flash模型云侧昇腾平台上的扩散模型进一步参与生成构建出更高质量的3D高斯模型再回到手机端完成渲染与呈现。端侧模型推理有助于节约运行成本。将MoWorld-2.0-flash部署在麒麟后相应计算环节对云侧资源的需求随之减少具体收益因业务流程、设备与使用场景而异。03 进一步探索研发成果的端云共用开发投入与运行成本共同影响AI应用的持续供给。对拥有模型研发能力的团队而言拓展终端产品既要承担新增的适配投入也要考虑应用上线后的计算成本。CANN端云协同从产品开发与服务运行两个阶段入手改善成本结构云侧研发投入能够服务于后续终端产品有助于降低拓展新场景时的额外工作量负担应用上线后结合业务需要灵活安排端侧与云侧计算则可进一步控制运行成本。端云生态协同的价值不止于此。欢迎昇腾与鸿蒙生态的开发者面向更多创新场景与CANN开源社区深入交流共同探索端云协同的更多可能。CANN - 开源代码托管,代码协作 - AtomGit
返回列表