ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

如何把 LoRA 权重合并进基础模型:swift 模型合并完整指南

如何把 LoRA 权重合并进基础模型:swift 模型合并完整指南 如何把 LoRA 权重合并进基础模型swift 模型合并完整指南【免费下载链接】swiftUse PEFT or Full-parameter to CPT/SFT/DPO/GRPO 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) and 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).项目地址: https://gitcode.com/GitHub_Trending/swift1/swiftLoRA 微调跑完之后很多人会卡在下一步把 checkpoint 直接丢给 vLLM 部署要么直接报错要么推理明显比纯基础模型慢。原因很简单——适配器权重只是一份增量补丁不是完整模型必须先融合回基础模型的权重矩阵里才能独立部署。swift 模型合并swift export --merge_lora子命令就是干这件事的一条命令输入训练好的 checkpoint输出一个可直接上线的完整模型。下面不先讲原理顺序是先跑通拿到合并产物再回头看 swift 底层做了什么最后处理容易踩的坑。把 LoRA checkpoint 直接推上线到底卡在哪LoRA 训练时冻结基础模型的原始权重只在旁边学习两组低秩矩阵 A 和 B。推理时每一层前向要先算原始的 W·x再叠加 (B·A)·scaling 的增量这带来三个实际麻烦适配器不能单独加载必须挂在基础模型上才能跑不少推理引擎对基础模型 适配器的组合处理不如对完整权重顺手多一份计算开销分发模型要同时给基础模型和 checkpoint 目录版本管理麻烦。合并做的事就是把这个增量折进原始权重W W (B·A)·scaling直接写进保存的参数里。合并完的模型不再依赖任何适配器在标准推理框架里的表现和原生模型一致。价值不止是能跑实际表现上完整权重模式的推理开销通常比基础模型 适配器低改善幅度在 15%–30% 这个区间并且天然兼容 vLLM、SGLang 这类部署链路。swift export 替你做了哪些事整个合并流程是四步细节都被swift export收在内部输入只需要一个 LoRA 训练输出目录产出是标准的 Hugging Face 格式模型merged_model/ ├── config.json ├── generation_config.json ├── model-00001-of-00002.safetensors ├── model-00002-of-00002.safetensors └── model.safetensors.index.json这个目录可以直接喂给swift infer、swift deploy或 vLLM无需再加工。快速上手三步参数跑通第一次合并安装并确认环境git clone https://gitcode.com/GitHub_Trending/swift1/swift cd swift pip install -e . swift --version主要依赖需满足torch 2.0、transformers 4.33、peft 0.11、modelscope 1.23。不确定可以用pip list | grep -E torch|transformers|peft核对一遍。合并时的显存参考合并要把完整基础模型读进显存所以显存需求接近甚至略高于该模型的全量推理模型规模最低显存推荐显卡7B16GBRTX 3090 / A1013B24GBRTX 4090 / A10070B80GBA100 / H100合并命令本体最简形态只需要两个参数swift export \ --adapters output/vx-xxx/checkpoint-xxx \ # LoRA 训练的 checkpoint 目录 --merge_lora true # 开启 LoRA 融合 # 可选--output_dir merged_model 指定输出目录⚠️ 容易漏的一点不传--output_dir时swift 默认把结果存到 checkpoint 同级的checkpoint-xxx-merged目录。这个目录如果已存在重跑会直接报错——要么换个输出目录要么加--exist_ok true允许覆盖。如果基础模型没有被自动定位到补一个--model手动指定即可swift export \ --adapters output/vx-xxx/checkpoint-xxx \ --merge_lora true \ --model Qwen/Qwen2.5-7B-Instruct \ # 基础模型 ID 或本地路径 --use_hf true # true 走 Hugging Face 源默认 ModelScope逐行解读基础模型信息从哪来权重存到哪去args.json 是那张小票swift 训练产出的 checkpoint 目录里都带着args.json记录了本次训练用过的--model、框架版本等参数。swift export优先读这个文件所以它知道该加载哪个基础模型、配哪套模板——你只要找得到 checkpoint 目录命令就能跑起来。文件缺失或信息不全时比如 checkpoint 是从别处拷来、目录结构不完整再手动补--model兜底。权重是逐层折进去的对每个挂了 LoRA 的线性层swift 算出低秩增量并直接加进原始权重然后卸载 A/B 矩阵最终保存目录里只剩完整权重。默认以 safetensors 分片保存分片大小由--max_shard_size控制默认 5GB不用操心单文件过大。参数细节可以对照仓库里的 docs/source/Instruction/Export-and-push.md 和最小示例 examples/export/merge_lora.sh。进阶玩法多适配器、量化、对接推理引擎一次合并多个适配器不同任务分别微调过、想合成一个模型时--adapters可以一次传多个目录swift 会按给出的顺序依次加载并融合swift export \ --adapters output/task-a/checkpoint-500 \ output/task-b/checkpoint-800 \ --merge_lora true合并 量化一条命令搞定如果合并完要直接按 4bit 部署不必先落盘再单独量化把量化参数加进来swift 会先完成权重融合再就地量化swift export \ --adapters output/vx-xxx/checkpoint-xxx \ --merge_lora true \ --quant_method gptq \ # 可选 awq / gptq / bnb / fp8 --quant_bits 4 \ # 量化位数常用 4 或 8 --dataset AI-ModelScope/alpaca-gpt4-data-zh#500 \ # 量化校准数据 --quant_n_samples 256 \ --quant_batch_size 1用 awq 或 gptq 时--dataset校准数据是必填项缺了命令会直接报错。直接对接 vLLM 部署合并后的目录就是标准模型目录可以直接作为引擎的启动参数python -m vllm.entrypoints.api_server \ --model merged_model \ --port 8000合并后怎么确认没出错验证与排错✅ 两步验证看文件再跑推理先检查输出目录是否完整对照上面的文件清单再用同一组问题分别跑基础模型 适配器和合并后的模型# 合并前 swift infer \ --model Qwen/Qwen2.5-7B-Instruct \ --adapters output/vx-xxx/checkpoint-xxx # 合并后 swift infer --model merged_model两边输出应当基本一致差异只应来自采样随机性合并模式下延迟的改善一般在 15%–30% 左右。不想碰命令行的话也可以打开 Web UIswift web-ui把合并后的模型路径填进去快速抽查效果。⚠️ 常见错误对照表错误现象可能原因处理办法加载模型时 OOM显存放不下完整权重换更大显存的卡或用--device_map分散显存70B 需要 80GB基础模型下载失败 / 不匹配args.json 里的基础模型信息缺失或不可达手动补--model必要时用--use_hf true换源args.json 缺失或为空checkpoint 不是 swift 训练产出的手动传--model及相关参数提示输出目录已存在-merged目录已经生成过换--output_dir或加--exist_ok true 从合并到上线三条建议保留原始适配器合并完别急着删 checkpoint之后想调整权重或回滚随时可以重新合并版本化命名输出目录加上版本号如merged-model-v1部署和回滚时好辨认显存紧张就合并 量化一步到位直接用前面的合并量化命令生成 4bit 部署包少一道工序。动手路径很短找一个训练好的 LoRA checkpoint跑swift export --adapters checkpoint --merge_lora true再用swift infer --model 输出目录抽查推理结果与合并前一致就可以放心投产了。【免费下载链接】swiftUse PEFT or Full-parameter to CPT/SFT/DPO/GRPO 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) and 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).项目地址: https://gitcode.com/GitHub_Trending/swift1/swift创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表