ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从零到第一张AI图:Qwen-Image-2.1-viggle-turbo diffusers快速上手完整教程

从零到第一张AI图:Qwen-Image-2.1-viggle-turbo diffusers快速上手完整教程 从零到第一张AI图Qwen-Image-2.1-viggle-turbo diffusers快速上手完整教程【免费下载链接】Qwen-Image-2.1-viggle-turbo项目地址: https://ai.gitcode.com/hf_mirrors/Viggle/Qwen-Image-2.1-viggle-turboQwen-Image-2.1-viggle-turbo 是由 Viggle 基于 Qwen-Image-2.1 用 DMD 蒸馏出的少步快速出图 LoRA只需6 步 transformer 前向基础模型要 40 步、无需 CFG 负提示端到端速度约为基础模型的5 倍质量却在多数提示词下难以分辨。配合 diffusers 库它可以同时完成文生图text-to-image和基于 1–3 张参考图的指令编辑。本文带你从环境安装到生成第一张 AI 图全程走一遍。它为什么快先花 30 秒搞懂原理 对比项Qwen-Image-2.1 基础模型Qwen-Image-2.1-viggle-turbo推理步数40 步6 步是否需负提示/CFG需要不需要CFG 关闭每步仅一次模型调用分发形式完整模型约 1.3 GB 的 LoRA 适配器运行时叠加到基础模型上质量基准绝大多数提示词下几乎看不出差别小字密集文本略弱8 步可改善蒸馏方法为DMD2 / SenseFlow 风格的分布匹配蒸馏。v0.2.1 是当前推荐版本仓库内的 v0.2、v0.1 文件仅作存档没有理由优先使用旧版。⚠️ 许可提醒本模型遵循Qwen RESEARCH LICENSE仅限非商业用途研究或评测。详见 LICENSE 与署名要求 NOTICE。一键安装步骤diffusers 环境准备首先用pip安装核心依赖pip install -U torch transformers5.17,6 accelerate safetensors peft pillow⚡ 注意一个坑QwenImage21Pipeline尚未进入已发布的 diffusers 版本README 要求安装锁定 commit 的 diffusers一条pip install git...命令。完整命令请照抄 README.md 的 Install 小节peft是必需的。三步加载模型基础模型 turbo LoRA turbo 调度器这是整个教程最核心的一段代码加载顺序有讲究import torch from diffusers import QwenImage21Pipeline, FlowMatchEulerDiscreteScheduler # 1) 加载 Qwen-Image-2.1 基础管线bf16 pipe QwenImage21Pipeline.from_pretrained(Qwen/Qwen-Image-2.1, dtypetorch.bfloat16) # 2) 叠加 v0.2.1 六步 turbo LoRA pipe.load_lora_weights( Viggle/Qwen-Image-2.1-viggle-turbo, weight_nameQwen-Image-2.1-viggle-turbo-v0.2.1-6step-lora-r256.safetensors, ) # 3) 必须使用仓库自带的调度器配置 pipe.scheduler FlowMatchEulerDiscreteScheduler.from_pretrained( Viggle/Qwen-Image-2.1-viggle-turbo, subfolderscheduler ) pipe.to(cuda)第 3 步不能省仓库自带的 scheduler/scheduler_config.json 把shift_terminal改成了null基础配置是0.02用错调度器配置会毁掉最后一步的去噪。 显存吃紧把 r2561.3 GB换成精确截断的rank 128 版本Qwen-Image-2.1-viggle-turbo-v0.2.1-6step-lora-r128.safetensors680 MB官方测量其与 r256 的图像差异LPIPS 0.0244基本处于数值噪声水平。生成你的第一张AI图文生图完整代码加载完成后出图只需一次调用image pipe( promptA studio portrait of an old fisherman mending a net, warm rim light, 85mm., height1024, width1024, num_inference_steps6, sigmas[1.0, 0.9375, 0.875, 0.75, 0.5, 0.25], true_cfg_scale1.0, # 无 CFG也是默认值 generatortorch.Generator(cuda).manual_seed(0), ).images[0] image.save(out.png) 保存下来这就是你的第一张 6 步 turbo AI 图。提示词建议写得长而具体模型是在增强后的长提示上蒸馏的官方提示词改写器PE-T2I / PE-I2I还能进一步提升构图与文字渲染效果。必背参数清单6步时间表与三条红线 v0.2.1 对采样参数非常敏感记牢下面这张表就不会翻车参数推荐值说明num_inference_steps6配合同行的sigmas一起传sigmas[1.0, 0.9375, 0.875, 0.75, 0.5, 0.25]原始 sigma 节点任意分辨率都照抄true_cfg_scale1.0不要开 CFG也不要用负提示调度器仓库自带配置shift_terminal: nullLoRA 强度1.0alpha 等于 rank不要改改步数的方式只在高噪端增删保持0.875, 0.75, 0.5, 0.25不动三条红线来自官方 Rules that matter不要移动低噪节点0.75 / 0.5 / 0.25——它们是学生模型训练时落点动了图像会整体变软不要叠加两个学生模型比如 LoRA 全量微调 transformer 一起上或两个 LoRA 同载LoRA 不要 merge运行时加载才是无损的merge 进 bf16 有损。另外参考图顺序决定提示词里 image 1 / image 2 指哪张图不指定height/width时输出宽高比跟随最后一张参考图。指令驱动图像编辑1–3 张参考图 ️同一对象直接复用加一个image参数就是图生图 / 编辑模式from diffusers.utils import load_image image pipe( promptReplace the background with a sunset beach, keep the subject unchanged., image[load_image(input.png)], # 列表顺序固定 image1、image2... output_resolution1024, num_inference_steps6, sigmas[1.0, 0.9375, 0.875, 0.75, 0.5, 0.25], ).images[0]训练时最多使用过3 张参考图超出数量未保证。不想写代码ComfyUI 六步出图工作流ComfyUI≥0.37.0原生支持 Qwen-Image-2.1用户可直接拖入现成工作流文件用途comfyui/viggle_turbo.py两个自定义节点复制到ComfyUI/custom_nodes/后重启comfyui/Qwen-Image-2.1-viggle-turbo-t2i.json文生图工作流含可选提示词增强组comfyui/Qwen-Image-2.1-viggle-turbo-edit.json多参考图编辑工作流comfyui/input/cat.webp 、 comfyui/input/woman2.webp编辑工作流的示例参考图复制到ComfyUI/input/两个关键节点Viggle Turbo Sigmasviggle_turbo.py生成带分辨率自适应 shift 的 6 步 sigma 序列替代 KSampler 的默认调度器Viggle Turbo LoRA (unmerged)viggle_turbo.py运行时以Wx BAx方式应用 LoRA避免 ComfyUI 原生 LoRA 加载器 merge 进 bf16/int8 权重带来的精度损失官方实测 LPIPS 差距约 0.093 → 0.038。模型文件放法int8 或 bf16 的 transformer、文本编码器、VAE 放入 ComfyUI 对应目录LoRA 选r128 文件放入loras/工作流默认配置在约 1 MP 图像上峰值约 26 GB 显存。选分辨率训练密度最高的档位训练主要覆盖 1024² / 1536² / 2048² 像素面积以下常见尺寸最稳完整表格见 README.md比例1 MPT2I 编辑2 MP编辑4 MPT2I1:11024×10241536×15362048×204816:91376×7682048×11522720×15363:21248×8321888×12482496×1664其他尺寸也能跑只是训练样本少。ComfyUI 侧记得宽高取 16 的倍数。常见问题与已知局限 ️小字/长文本渲染偶尔乱码比 40 步基础模型更常见把步数加到8 步sigmas[1, 0.9375, 0.875, 0.75, 0.625, 0.5, 0.25, 0.125]明显更干净复杂编辑会打折扣多参考图构图、换脸、身份保持类编辑仍可能落后基础模型偶发重影/身份漂移2K 输出目前只有视觉对比没有量化指标ComfyUI 旧驱动报错comfy_kitchen0.2.35 在 NVIDIA 580 之前驱动上会让提示词增强节点报 CUDA 错误升级驱动或关闭Enhance prompt即可不影响出图。仓库文件速查 文件说明Qwen-Image-2.1-viggle-turbo-v0.2.1-6step-lora-r256.safetensors✅推荐v0.2.1 LoRArank 256diffusers 键名1.3 GBpeft_v0.2.1/adapter_model.safetensors同一适配器在 peft 键名格式下的版本二选一勿混用Qwen-Image-2.1-viggle-turbo-v0.2.1-6step-lora-r128.safetensorsrank 128 截断版省显存ComfyUI 工作流默认transformer/config.jsonv0.1 全量微调 transformer存档无需使用LICENSE / NOTICE非商业研究许可与署名要求从安装到出图你只需要记住一句话基础模型 v0.2.1 LoRA 仓库调度器6 步、无 CFG。跑通第一张图之后照着必背参数清单微调提示词和分辨率就是日常使用 Qwen-Image-2.1-viggle-turbo 的全部心法。【免费下载链接】Qwen-Image-2.1-viggle-turbo项目地址: https://ai.gitcode.com/hf_mirrors/Viggle/Qwen-Image-2.1-viggle-turbo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表