ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DeepSpeed Windows 安装部署指南:pip 一条命令装好,单卡跑通训练、微调与推理

DeepSpeed Windows 安装部署指南:pip 一条命令装好,单卡跑通训练、微调与推理 DeepSpeed Windows 安装部署指南pip 一条命令装好单卡跑通训练、微调与推理【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeedDeepSpeed 是微软开源的深度学习优化库核心能力是 ZeRO 显存优化与 3D 并行可显著降低分布式训练与推理的显存开销。本文给出 Windows 下 DeepSpeed 的完整安装部署步骤并用 CIFAR-10 预训练、LoRA 微调、ZeRO-Inference 推理三个场景验证环境读完即可独立跑通从环境检查到模型出结果的完整流程。部署前的环境自检Windows 原生支持 DeepSpeed 0.14.5 及以上版本训练与推理均可用AIO 异步 I/O 和 GDS 暂不支持。动手前先按下表核对一遍每项都给了可直接复制的校验命令检查项建议配置说明校验命令操作系统Windows 11 23H2 及以上家庭版需先开启开发者模式winverPython3.10 – 3.113.12 暂不在验证范围内python --versionPyTorch2.3.0cu121必须与 CUDA 版本匹配python -c import torch; print(torch.version.cuda)CUDA Toolkit12.1pip 路线无需单独安装仅源码编译需要nvcc -V编译工具链VS2022 C x64/x86 build tools仅源码编译路线需要cl --version⚠️ 顺序很关键无论走哪条路线PyTorch 都要在 DeepSpeed 之前装好。部署路线一pip 快车道适合大多数人Windows 版 pip 包自带全部预编译算子不依赖 CUDA SDK 和本地 C 编译器一条命令完成pip install deepspeed0.14.5安装完成后终端会直接显示 wheel 下载与安装成功无需任何编译过程部署路线二源码编译需要定制构建时需要自行控制算子构建选项、或跟进仓库最新提交时再走源码路线。仓库中 MANIFEST_win.in 定义了 Windows 打包清单build_win.bat 是编译入口git clone https://gitcode.com/GitHub_Trending/de/DeepSpeed cd DeepSpeed build_win.bat pip install dist\*.whl注意两点需以管理员身份运行或打开 Visual Studio 2022 Developer Command Prompt 再提权否则创建符号链接目录会报Access denied算子构建逻辑集中在 op_builder/builder.py依赖清单见 requirements/requirements.txt。安装验证用 ds_report 确认算子状态两条路线装完后都执行同一个体检命令ds_report它会打印 PyTorch、CUDA、deepspeed 版本信息以及每个 C/CUDA 算子的 installed / compatible 状态。JIT 模式下未预装的算子会在首次运行相关功能时按需编译并缓存到~/.cache/torch_extensions/所以看到部分算子显示[NO]不必紧张关键是版本信息与 GPU 检测正常场景演练以下三个场景都基于官方示例脚本DeepSpeedExamples 仓库的training/cifar、training/DeepSpeed-Chat与zero-inference目录硬件为单张 RTX A20004GB 显存。场景 1单卡预训练 CIFAR-108 分钟验证引擎可用性deepspeed cifar10_deepspeed.py --deepspeed在 4GB 显存上约 8 分钟跑完 5 个 epoch10000 张测试图整体准确率 59%其中 plane 类别最高达 76%FP16 训练过程中的动态损失缩放日志正常输出说明混合精度链路完整场景 2LoRA 微调 OPT-125M小显存做监督微调LoRA 即低秩适应只训练插入的小矩阵而冻结原权重参数更新量远小于全量微调。叠加 ZeRO-2 阶段把优化器状态分片到多卡与 CPU offload 后4GB 显存即可运行 0.146B 参数的监督微调SFTdeepspeed main.py --model_name_or_path facebook/opt-125m \ --gradient_accumulation_steps 8 --lora_dim 128 --only_optimize_lora \ --zero_stage 2 --dtype bf16 --offload --print_loss训练日志显示 loss 从约 9.5 稳定下降吞吐约 8 tokens/s、延迟 1.2–1.9msbf16 精度下无溢出跳步场景 3ZeRO-Inference 推理 Llama-2-7B权重卸载到 CPUZeRO-Inference 把模型权重从显存卸载到 CPU 内存甚至 NVMe需要哪一层就调哪一层让 4GB 显存也能跑 7B 模型。这里用 8 token 提示词生成 32 个 token、批大小 64deepspeed run_model.py --model meta-llama/Llama-2-7b-hf \ --batch-size 64 --prompt-len 8 --gen-len 32 --cpu-offload输出摘要显存峰值 2.747GB4GB 卡内decode 吞吐 12.97 token/s整批 832 token 总耗时 157.86s生成内容为连贯的Paris is the capital of...排错手册错误现象可能原因修复动作cl.exe: not found/ 提示找不到编译器未安装 MSVC 构建工具或未用开发者命令行安装 VS2022 C x64/x86 build tools用 Developer Command Prompt 重新执行LNK1181: cannot open input file aio.libAIO 算子在 Windows 上不可用可忽略AIO 与 GDS 不在 Windows 支持范围内CUDA error: no kernel image is available扩展没有针对当前 GPU 架构编译重装与 CUDA 匹配的 torch或设置TORCH_CUDA_ARCH_LIST6.1;7.5;8.6后重新构建Installed CUDA version ... does not match the version torch was compiled with系统 CUDA 与 PyTorch 编译用 CUDA 主版本不一致用nvcc -V与torch.version.cuda对齐版本确需跳过检查可设DS_SKIP_CUDA_CHECK1Access denied、符号链接创建失败终端权限不足以管理员身份运行 PowerShell / 命令提示符首次运行卡顿很久后正常JIT 模式首次编译算子并写入缓存属正常现象想预编译可DS_BUILD_OPS1 pip install deepspeed多 venv 用户用TORCH_EXTENSIONS_DIR隔离缓存进阶方向装好并验证之后还有这些方向可以顺藤摸瓜多 GPU 与多节点训练deepspeed启动器支持--hostfile、--include/--exclude指定资源以及--no_ssh的无 SSH 启动模式详见 docs/_tutorials/getting-started.md配置化调参所有功能开关都收敛在一份 JSON 配置里train_batch_size、zero_optimization、fp16等完整字段参考 docs/_pages/config-json.md算子按需预编译通过DS_BUILD_FUSED_ADAM、DS_BUILD_TRANSFORMER等开关只构建需要的算子清单与功能级依赖见 requirements/ 目录新特性跟进仓库 blogs/ 目录持续更新 ZeRO、DeepCompile、Ulysses 序列并行、SuperOffload/ZenFlow 卸载等能力Windows 支持范围也在逐步扩大关注 blogs/windows/ 即可。写在最后到这里DeepSpeed 在 Windows 上的安装部署链路——环境自检、双路线安装、ds_report验证、三类模型任务出结果——已经完整闭环。想继续深入可以从官方入门教程 docs/_tutorials/getting-started.md 和 Windows 专项说明 blogs/windows/08-2024/chinese/README.md 入手。【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表