ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Stable Diffusion图生图(img2img)全解析:从重绘幅度到ControlNet实战

Stable Diffusion图生图(img2img)全解析:从重绘幅度到ControlNet实战 Stable Diffusion玩到一定阶段都会碰到这样一个问题文生图的随机性太大生成什么完全靠抽卡。哪怕你的提示词写得再精准模型理解出来的构图、姿势、光影也未必是你脑海里那张图。这时候真正拉开玩家差距的就是img2img图生图模式。它把生成过程从从噪声中凭空创造变成了在已有图像上定向演化这就像给你一支画笔而不是一块画布——你不再依赖模型猜你想要什么而是直接告诉它方向和幅度。这篇内容我打算直接把img2img模式从底层原理到参数调优、再到各种实战玩法全部拆开讲清楚。适合两类人看一是刚入门、图生图只会拖一张图进去然后乱调重绘幅度的新手二是已经能稳定出图但总觉得图生图效果不可控、想系统化理解这个模式的进阶玩家。我会尽量用具象化的方式讲透这个模式的工作原理再给出大量我自己实测过的参数组合和操作思路。1. 先从一张重绘的图说起img2img到底在做什么很多人在刚接触图生图时会把它理解成一个简单的滤镜工具或者风格化工具。这种理解不算错但远远低估了img2img的能力。它不是一个把照片变成油画风格的程序而是一个完整的图像生成流程——把一张已有的图片和一段文字描述一起交给模型让模型在参考原图结构的同时按文字描述重新生成一张新图。1.1 为什么img2img比txt2img更容易控制结果理解这个问题的关键在于Stable Diffusion的工作机制。文生图时模型拿到的是纯噪声——一张没有任何信息量的雪花噪点图然后根据文字描述一步步去噪最终生成图像。这个过程里模型只能依赖文字描述和它对世界的先验知识来猜测你想要的画面所以结果往往会和你的想象有偏差。你写一只戴帽子的猫它可能给你画出一只戴着草帽的橘猫但你可能想要的是戴礼帽的黑猫这就是典型的方向偏差。而img2img把起点从纯噪声换成了一张已经有明确结构的图片。模型去噪的每一步都会参考原图的潜空间特征确保生成结果在构图上、整体结构上不会偏离原图太远。你给它一张戴草帽橘猫的照片再加提示词black cat, wearing a top hat模型会在保留猫咪姿势、背景结构的前提下把毛色换成黑色、把草帽换成礼帽。你给予的信息越多模型的发挥空间就越少结果自然越可控。我用的比喻是文生图是把一个从外地来的画家带到一片空白画布前让他根据你的口述画一幅画结果完全看这个画家的脑补能力img2img则是你给这个画家一张草图告诉他在此基础上修改他再怎么自由发挥也得先尊重你给的构图基础。1.2 这个模式的代码层面到底发生了什么如果想精确理解img2img你需要知道一个概念Stable Diffusion并不直接处理像素图而是用VAE把图片编码到潜空间latent space在这个低维空间里做去噪处理然后再用一个解码器把潜空间向量还原成图片。img2img的流程具体拆解是先把你输入的原图经过VAE编码成潜空间的一组特征张量然后根据你设定的重绘幅度Denoising Strength往这组特征里注入一定量的噪声。最后模型从加了噪声的潜空间特征出发结合你的提示词去噪重建出新的图像。这里最关键的参数就是Denoising Strength重绘幅度。它决定了你有多大程度破坏原图的潜空间特征再让模型重建。重绘幅度0.1-0.3原图结构基本完整保留只有细节纹理轻微变化重绘幅度0.4-0.6构图不变但色彩、纹理、风格会发生明显改变重绘幅度0.7-0.8原图结构只有大轮廓被保留细节几乎全部重建重绘幅度0.9以上原图只剩一个模糊的影子基本等于重新生成理解这个逻辑之后你会发现img2img的可控性核心不在于提示词写得多华丽而在于你能否精准控制重绘幅度这条破坏-重建曲线的位置。后面我会详细讲不同场景下该用什么参数。2. 核心参数逐个拆重绘幅度、采样步数、CFG在img2img里的角色差异图生图的参数面板看着和文生图很像但实际每个参数在img2img里的作用权重和文生图完全不同。如果你沿用文生图的调参习惯去推图生图大概率会得到一堆脏乱差的结果。这部分我把我实测的几个关键参数的差异逻辑整理出来。2.1 重绘幅度不是越大越好它和采样步数存在联动重绘幅度Denoising Strength是img2img最核心的滑块但它从来不是孤立起作用的。它和采样步数Sampling Steps之间存在一个强耦合关系去噪过程中的有效步数约等于总步数乘以重绘幅度。举个例子如果你设置总步数是30步、重绘幅度是0.5那么模型实际进行去噪的步数只有15步左右如果你的重绘幅度是1.0那基本等于全步数去噪接近文生图的完整过程。这带来一个很反直觉的结果高重绘幅度情况下你把采样步数设置很高意义不大因为模型在这么多步中已经彻底摆脱原图的约束纯粹按提示词重新生成而低重绘幅度情况下步数太高反而容易导致画面过度优化、产生不自然的塑料感。我常用的组合是轻度微调0.2-0.3步数20-25中度重绘0.5-0.6步数25-30大改构图0.75-0.85步数30-35注意不同采样器对步数敏感度不同。DPM 2M Karras这类采样器收敛速度很快20步出图质量已经够用但如果你用Euler或者Heun这一类25步以下可能还能看到明显的噪点残留。所以实际调参时不要只盯着重绘幅度要结合采样器特性一起试。2.2 CFG Scale在img2img里的作用被稀释了文生图时CFG提示词引导系数控制的是生成结果遵循提示词的程度通常设为7-9。但在img2img里这个参数的作用会打折扣——因为除了提示词引导原图本身也在引导模型相当于有两个力量在拉扯最终结果。实测下来在img2img模式下CFG高到12以上画面容易出现色彩过饱和、边缘过锐的烧焦现象。这主要是因为原图信息给模型提供了一个天然的正确答案提示词再施加高强度的引导两个信号在潜空间打架结果就是伪影和色块。更合理的逻辑是重绘幅度越低CFG反而可以适度降低5-6已经够用重绘幅度越高CFG可以拉回7-9来强化提示词的约束力。我自己比较习惯的思路是把CFG当作fine-tune提示词影响力的旋钮而不是让它在img2img里充当主角。主角永远是重绘幅度CFG只是辅助微调提示词的作用力。2.3 分辨率设置和重绘幅度的配合比你想象的更重要做图生图时很多人直接把原图传上去然后保留默认分辨率设置结果生成的图总是存在模糊或者结构变形的问题。原因在于Stable Diffusion对输入图像的尺寸是有偏好的——它训练时用的是512x512或者1024x1024这类整数宽高比。如果你传的是一张800x600或者 768x512和其他非标准比例的图片模型在编码到潜空间时会做resize处理导致构图被拉伸变形。img2img面板里有个Resize mode选项常见的有三种Just resize直接把图拉伸到目标尺寸。适合构图简单、拉伸后不影响整体结构的图但人物肖像用这个选项容易拉变形Crop and resize先把图等比缩放然后居中裁剪到目标尺寸。适合保留主体但对边缘内容有裁切Resize and fill等比缩放后用镜像填充补齐空白区域。适合原图比例和目标比例差距大、又不想牺牲内容完整性的场景实战里面我最常用的是Crop and resize因为大多数情况下我都只要主体内容边缘被裁掉反而能去除干扰元素。而Resize and fill更适合做壁纸类、横幅类需要铺满画面的场景。另外一个非常容易被忽略的点是重绘幅度较高时建议先在低分辨率下测试构图确认没问题后再用放大算法提升分辨率。直接在1024x1024下用高重绘幅度反复迭代不仅速度慢出现结构崩坏时排查起来也更麻烦。3. 图生图的几种典型玩法从线稿上色到写实照片转二次元img2img真正强大的地方在于玩法多样性同一个模式搭配不同参数和准备工作可以完成完全不同的任务。我挑几种我自己经常用的场景来讲每种都有明确的参数方案和操作要点。3.1 线稿上色与草图细化白底线稿提色最快路径很多画师和设计师会手绘线稿或草图然后想快速看到上色后的效果。Stable Diffusion img2img基本秒掉传统手绘上色流程——你只需要一张干净的白底线稿加一段描述配色和画风的提示词三分钟内能出几十个配色方案。操作流程是准备一张线稿图背景纯白线条清晰提示词里写清楚lineart, flat color, anime style或具体画师风格词重绘幅度控制在0.5-0.65之间太低颜色上不进去太高线稿会被破坏开启ControlNet的Lineart模型如果有条件能极大程度保线稿结构但如果你没有ControlNet也不着急可以用内置的重绘幅度调参来硬做。关键是白底必须足够干净因为Stable Diffusion会把白底也当成画面内容的一部分。如果底色偏灰或者有纸纹生成结果里会出现大面积脏色。我常常先把线稿拖进PS里用阈值把底色处理成纯白再进行图生图。前处理不做干净后面怎么调参数都是白搭。3.2 写实照片转二次元最出效果但也最容易翻车的场景照片转动漫应该是图生图里被玩得最多、也最容易产生惊艳效果的用途。核心目标是在保留照片人物神情和构图的基础上把材质和渲染方式切换到二次元风格。这个场景的参数我建议从以下起点开始调整重绘幅度0.5-0.6首测采样器DPM 2M Karras步数30提示词anime style, detailed face, clean lineart, vibrant colors加负面词photorealistic, 3d render, blurry如果效果出来发现人物五官还是不够动漫化就把重绘幅度往上调一点如果出来了脸崩了或者五官结构不对可能是原图本身太小。照片分辨率低于800x800的话脸部细节信息不足模型没有足够的像素去理解五官结构重绘时容易放飞自我生成一张似是而非的脸。我个人的建议是照片转二次元最理想的原图尺寸是1024x1024或更高。如果你手头只有低清小图先做一步超分比如用ESRGAN或者Stable Diffusion放大脚本把图片分辨率提到1024以上再进img2img流程出图干净程度会好很多。3.3 粗糙3D渲染转高质量概念图游戏原画师的偷懒神器这个用法相对小众主要是做游戏美术或概念设计的朋友在用。用Blender或SketchUp快速拉一个白模或粗糙渲染图然后丢进img2img配合风格提示词能快速产出多张高质量的概念设计图用于方案汇报和方向探索。这个场景的特点在于原图本身结构比较简单、没有太多细节所以重绘幅度可以开得比较高0.65-0.75让模型去脑补大量材质和光影细节。提示词则重点描述材质和氛围octane render, cinematic lighting, intricate details, high concept art quality这一类型的词组合很关键。操作上有个小技巧把粗糙渲染图的背景统一成纯色深灰或白色可以减少模型在背景区域自由发挥时产生的杂乱元素干扰。我见过很多人在这个环节偷懒不处理背景结果生成图里到处都是莫名其妙的漂浮物体。4. 关键技巧用ControlNet锁结构用img2img填细节如果你只靠重绘幅度去控制结果会发现它的能力边界——想保留姿势却不要背景很难。想保留背景色但替换物品也很难。当你需要更精细地锁住原图中的某一部分信息再对另一部分做重绘时就该请出ControlNet了。ControlNet不是img2img的插件而是一个独立的条件控制网络它读取一张参考图的结构信息可以是线稿、深度图、骨骼姿态、语义分割图等把这个结构信息作为强条件输入到模型生成过程中。img2img配合ControlNet等于把模糊控制升级成精确控制。4.1 保留人物姿势img2img OpenPose是黄金组合如果你通过图生图修改人物服装或背景但不希望人物姿势有任何改变纯靠低重绘幅度0.3以下虽然能做到代价是画面其他部分的重绘空间也被压缩了改不出效果。这时候开启ControlNet的OpenPose预处理它会先自动检测原图中人物的骨骼关键点把姿势信息提取出来在生成过程中强制模型维持同样的姿势。这样即使你把重绘幅度调到0.6以上人物还是那个动作但衣服、背景、画风都能大幅改变。我管这叫单点锁死——你只用这一张参考图控制住你最在意的那个变量剩下的事情全交给提示词和重绘幅度去发挥。4.2 锁构图Canny图生图适合建筑和场景设计Canny边缘检测会把图片里所有物体的轮廓线提取出来然后作为控制条件强制生成结果遵循这些轮廓线。在建筑改色、工业设计、场景重构这类对空间结构要求高的任务里特别好用。具体做法原图丢进ControlNet预处理器选Canny然后调整Canny的最低阈值和最高阈值——通常保持默认即可但如果想要保留更多细节轮廓可以把阈值调低、想要更概括的轮廓就调高阈值看预处理预览图确定自己需要的轮廓密度再决定阈值。重绘幅度可以放心拉到0.7左右模型会沿着轮廓线填充新的材质和光影但建筑的结构比例基本不跑偏。4.3 不要忽视Depth和MLSD在特定场景的作用Depth深度图适合需要保持空间层次关系的场景人像摄影、产品拍摄这类对前后景关系有要求的任务特别适合。MLSD则适合室内设计和建筑制图它提取直线信息对透视感较强的图像有很好的结构约束。这里我想强调一个容易踩的坑ControlNet控制力越强画面的自由度就越低容易让生成结果呆板、没灵气。实际使用中不要所有图都启用ControlNet当你希望模型在构图基本正确的前提下来一点意外之喜时关掉ControlNet只靠img2img的重绘幅度反而能激发更多创意可能。5. 不同底模在img2img上的表现差异与选择逻辑不少人问我同样一张图同样的参数为什么用不同模型出来的效果天差地别确实如此——img2img对模型风格的耦合程度远高于文生图。因为原图提供的信息占很大权重模型自身的艺术风格会和原图内容产生化学反应不同模型对这些信息的理解和重构方式不一样最终呈现的效果自然不同。如果你用的是像秋叶整合包这类集成了多个模型包的本地环境在SD1.5、SDXL甚至更新架构的模型之间切换你会明显感受到同样的图生图参数在不同模型上输出的风格差异巨大。5.1 SD1.5系模型细节宽容度高、上手难度低SD1.5系列的社区底模数量巨大风格覆盖极其广泛。对img2img来说SD1.5模型最大的优点是它们训练时的基座分辨率是512x512细节识别粒度比较小所以对低分辨率原图比如网络上的小尺寸图片有更好的容错能力。如果你拿一张模糊的、噪点较多的参考图去做图生图SD1.5模型还能勉强处理出一个相对干净的结果。但到了SDXL时代模型默认分辨率建议在1024x1024左右低清原图压根不够模型去理解细节直接出图很容易崩脸或出现奇怪的纹理。5.2 SDXL系模型质感更强但重绘幅度窗口更窄SDXL模型的图生图能力非常强尤其在材质表达、光影层次和语义理解方面比SD1.5高出一个档次。但它的代价就是——对原图质量和重绘幅度更敏感。我自己用SDXL做img2img的体会是重绘幅度超过0.65之后画面很容易进入过拟合状态——模型突然开始不讲结构直接在原有的基础上画出大量语义重复的元素比如脸上叠出三只眼睛或者衣服纹路突然变成了一堆乱码。相比之下SD1.5系列在0.7-0.8的重绘幅度下还能保持一定的合理性。所以如果你用的是SDXL系模型建议把重绘幅度控制在0.55以下做微调0.6-0.65之间做中度修改超过0.7就要做好反复跑多批次的心理准备。而SD1.5则有更大的自由度重绘幅度0.7是一个比较从容的起点。5.3 特化模型实现风格迁移的捷径社区里有很多专攻特定风格的模型比如专画赛博朋克、水墨风、厚涂、水彩的checkpoint。这些模型在img2img里能发挥风格覆盖作用——即使原图是写实照片用特化模型搭配较高重绘幅度0.6-0.75也能比较自然地把照片风格迁移成特定画风。越特化的模型图生图风格迁移越明显但同时它对原图内容的解释权也越大生成结果可能和你想保留的内容有偏离。我在这个环节的建议是先用通用模型把构图调稳定确定主体内容满意后再切换到特化模型做最终的风格重绘。中间过程不要直接上特化模型不然后面要花大量时间清理模型自己脑补出来的奇怪元素。6. 实战中经常翻车的几种情况与排查链路图生图模式用久了你一定会碰到各种奇奇怪怪的出图事故。这部分我总结几种高频翻车场景并给出完整的排查思路帮助你快速定位问题根源。我个人建议不要急着改参数先搞清楚是哪个环节出了岔子。6.1 重绘之后人物脸崩了先检查原图结构信息如果说图生图翻车第一名脸崩绝对当之无愧。现象是原图里一张清晰端正的脸重绘之后要么五官变形、要么左右不对称、要么出现恐怖谷效果。很多人第一反应是降低重绘幅度但这往往治标不治本。排查链路如下第一步确认原图分辨率是否足够高。如果人脸区域低于256x256像素模型根本提取不到足够的五官细节重绘时自然会脑补出畸形的脸。对策是先做超分放大或裁剪人脸区域单独重绘。第二步确认是否开启了面部修复face restoration功能。有些整合包里默认开启ADetailer或Face Detailer在低重绘幅度下这些修复插件有时反而会和img2img的生成过程产生冲突导致脸越修越怪。第三步检查负面提示词里是否包含ugly, deformed face等基础负面词。不少新手会把负面词写得很随意恰恰漏掉了最该屏蔽的face-related项。如果以上都排查过问题依旧那就试一下把重绘幅度降低到0.35以下并在局部重绘时圈定脸部区域只对脸部做精细修改。很多时候全图重绘和局部重绘的脸部表现差异是巨大的。6.2 画面发灰、颜色脏大概率是CFG和重绘幅度失衡图生图结果发灰、颜色浑浊的问题尤其是在照片转手绘、照片转动漫时最常出现。核心原因是原图的色彩分布破坏了模型生成时对色彩纯度的偏好。我的排查步骤先看CFG Scale是不是太高。CFG在img2img里超过10色彩饱和度和明暗对比容易失真俗称烧色看起来就是颜色发脏。把CFG降到6-7观察一下。再检查重绘幅度。中等重绘幅度0.4-0.55最容易出现不上不下的脏色阶段——原图信息还在模型的色彩重建还没完全接管两个色彩体系在画面上重叠。要么降低到0.3以内做微小变化要么提高到0.65以上让模型完全接管色彩重建。确认采样器类型。Euler a和DPM SDE这类随机性较强的采样器在img2img中更容易产生色彩噪声如果画面中有明显的彩点点缀改回DPM 2M Karras会干净很多。6.3 重绘出来的物体数量增多或减少语义扰动问题这个翻车场景很奇特原图里有一个人重绘之后变成了两个人原图里有三棵树重绘之后变成了一整片森林。这是模型在去噪过程中受到提示词语义和原图结构之间互相矛盾导致的语义扰动。例如你给一张单人照片提示词里写了group of people或crowd模型会尝试在原图构图基础上塞入更多的人结果就是人物数量失控。反过来如果原图里有明确的两只猫提示词里只写了cat而没限定数量模型可能把其中一只抹掉。处理办法提示词里用数量限定词比如one persontwo cats减少语义歧义降低重绘幅度到0.4以下保留原图的内容数量信息如果开启ControlNet用语义分割Segmentation或者Depth控制数数量信息这个问题本质上是模型对数量这个概念理解力不够稳定比它对颜色材质的理解弱不少。知道这个机理后其实只要在提示词层面做约束大部分翻车都可以规避。7. 进阶玩法局部重绘Inpaint和图生图如何搭配使用很多人在图生图里遇到的最大痛苦就是牵一发而动全身——我只是想改个背景结果整个人物也跟着变了。这时候局部重绘Inpaint功能就是最终的解决方案。它本质上不是独立于img2img的模式而是在img2img框架里增加了一个蒙版让你只对选中区域做重绘未选中区域保持原样。注意局部重绘和整体重绘的思维方式完全不同。整体重绘时你操心的是我要改动多大程度局部重绘时你操心的是我要把重绘区域限定得多准确。7.1 ControlNet的Inpaint模型 vs 内置局部重绘功能现在常用的局部重绘有两种方式一是Stable Diffusion WebUI自带的Inpaint功能直接在原图上用蒙版笔刷涂出要修改的区域二是ControlNet的Inpaint模型它把蒙版作为条件控制信息送入模型。两者的核心区别在于ControlNet方式能更好地理解蒙版边界在蒙版边缘的处理上更加自然不会出现明显的贴纸感。内置功能则更适合快速试效果尤其在蒙版区域比较规整时效率更高。我的使用习惯是粗略修改用内置Inpaint追求精修效果切换ControlNet Inpaint局部重绘低重绘幅度的组合。每次需要改动画面某个细节但不想改变整体氛围时这个组合可以帮你省下大量反复重roll的时间。7.2 局部重绘的蒙版边缘优化这决定你的修改是否隐形很多人在局部重绘时忽略了一个关键参数蒙版边缘的羽化Mask Blur。默认值通常是4-8像素但它对最终效果影响巨大。如果蒙版边缘羽化值太小模型在蒙版内外之间的过渡会很生硬重绘区域和保留区域之间会产生明显的接缝。如果羽化值太大重绘影响会渗透到不想改变的区域造成不必要的扰动。我的经验参数原图1024x1024的情况下Mask Blur设置为12-20像素比较稳妥。如果原图边缘特征比较复杂比如头发丝、树叶边缘建议把Mask Blur再调高一些让模型有更大的自由度去融合边缘。但注意羽化过大也会让蒙版区域的边界偏移生成结果可能不只是你要改的那部分。另外局部重绘时有个容易被忽略的选项蒙版模式Mask Mode分为重绘蒙版内容和重绘非蒙版内容。前者是你涂哪里改哪里后者是除了你涂的地方之外全部重绘——后者最适合用来保留画面中某个核心物体然后把背景整个换掉的场景。7.3 多次局部重绘的组合使用复杂改图的正确姿势工作中我经常遇到的需求是一张图既要换掉背景又要改人物的衣服还要调整画面的色调。这种多目标修改如果一次性完成模型很容易在相互矛盾的指令之间失去方向最后哪个目标都没做好。正确的做法是分阶段执行第一步先用局部重绘把背景区域蒙版选中用较高的重绘幅度0.7左右配合背景描述的提示词单独重绘背景第二步再对人物服装区域做蒙版开启局部重绘此时重绘幅度降低到0.5左右只重绘服装细节第三步做整体色调和画风统一用较低的重绘幅度0.35-0.4全图跑一遍。这种层层递进的方式能让每一步的目标都比较单一模型在每个环节需要处理的变量少输出稳定度自然高很多。这个方法论其实就是把一个复杂的图像编辑任务分解成多个可控的小任务——和软件开发里模块化设计的思路如出一辙。8. 图生图实操流程复盘整理一套人人可用的完整工作流前面讲了很多原理、技巧和参数最后我把这套经验浓缩成一套可以直接上手执行的完整工作流方便你下次打开图生图界面时不用一脸茫然不知道从哪里下手。这套流程是我平时开工时的基准涵盖了从准备到输出管理的完整链路。准备阶段定目标想清楚这次图生图是要改风格、改元素、还是修细节。目标不同参数起点完全不同修底图确保底图分辨率不低于768结构清晰、背景尽量干净。有需要就先用PS或其他工具做裁剪、超分处理选底模根据目标风格选择合适的checkpoint模型。风格定向的修改优先切换特化模型内容保真优先用通用模型参数设置阶段重绘幅度从0.5开始试验根据效果上下调节采样器DPM 2M Karras作为默认追求细节用DDIM步数30步左右不要过多CFG Scale控制6.5-7.5之间按提示词复杂度微调分辨率与被处理图尺寸匹配避免模型resize导致的拉伸变形执行与迭代阶段第一轮用较低重绘幅度0.4-0.5跑4-6张主要看构图和内容保真度第二轮从中挑出构图满意的图提高重绘幅度0.6-0.65增加风格提示词强度跑4-6张看风格表现第三轮锁定一张最满意的局部重绘修细节或配合ControlNet进一步锁定结构输出阶段高清放大用Hires.Fix或Ultimate SD Upscale把最终结果放大到目标分辨率后期处理导出后用PS或Lightroom微调色彩、对比度去除少量瑕疵。不要追求完全脱离后期的一步到位熟练的AI绘画用户都会把一部分工作放到后期解决这套流程唯一的目的就是减少不必要的盲猜——每一步都有一个明确的判断依据和决策路径而不是把参数乱拖一通然后拼命刷批次。9. 我的几点心得与偏好最后聊一些偏个人的经验和偏好。虽然AI绘画工具迭代飞快但很多底层的使用思路是不太会变的。其一关于趋势的体感早期大家做图生图重度依赖重绘幅度滑块现在ControlNet铺开之后大家追求的是先锁定结构再用提示词和专用模型驱动风格。从结果来看这种做法的稳定性和可复现度高太多了。所以我建议新手朋友不要太早陷入调参玄学的泥潭先把ControlNet的几种基本用法吃透再回头玩纯img2img参数会觉得豁然开朗。其二关于秋叶整合包这类本地环境很多人安装完就急着跑图其实值得花点时间研究一下插件管理面板。图生图的体验和预处理器、ControlNet模型的安装完整性强相关缺一个模型文件都会导致功能不可用或报错。如果你发现图生图和教程里表现不一致优先检查环境里的模型和插件版本而不是怀疑自己的参数有问题。其三真正好看且有灵性的结果很少是一次成型的。我过去复盘过自己比较满意的作品绝大多数都经过了至少三轮以上的迭代——第一轮定构图第二轮调风格第三轮抠细节期间还需要回到PS做局部修改再重新喂进去。AI绘画最忌讳的心态就是一锤子买卖图生图给了你极高的迭代效率那就应该最大限度利用这种反馈-修正的循环去逼近理想画面。这个思路反过来也会让你对参数逻辑的理解越来越深很快就摆脱对着教程一步步照做的阶段了。
返回列表