
最近AI漫剧这个赛道肉眼可见地热了起来。身边不少做短视频的朋友开始往这个方向转型平台上的AI漫剧账号也有起量的趋势。我是在ComfyUI和minimaxH3这套组合彻底跑通之后才真正觉得“AI漫剧”这件事是可以被普通人掌握的。工具链已经足够成熟难的不是某个高深的技术而是没有人把完整的流程串起来讲明白。这篇文章我想直接把手上这套方法交出来剧本、分镜、静帧、视频生成、配音、剪辑一条线全部走通。我尽量用大白话讲把每一步的细节、参数、容易踩的坑都写清楚。不管你是完全没接触过ComfyUI的小白还是已经会出图但没做过视频的老手照着这个流程都能做出自己的AI漫剧短视频。1. 先搞懂AI漫剧是怎么做出来的1.1 AI漫剧到底是什么为什么值得做AI漫剧本质上就是“漫画感的短剧”你看到的是类似漫画分镜的画面但每一格又是动态的人物有表情变化、镜头有推拉摇移再配上配音、音效、字幕最后剪成一条竖屏短视频。它跟传统短剧最大的区别在于传统短剧需要真人演员、实景拍摄、剧组配置而AI漫剧只需要一台电脑、一套AI工具、一个人就能完成大部分工作。为什么这个赛道值得关注先说成本传统短剧一集的制作成本动辄几万到几十万AI漫剧如果把全流程跑熟单集成本可以压到几十块钱的电费和算力消耗。再说效率传统短剧从立项到上线少说要一两个月AI漫剧如果素材生成顺利一天出一集不是梦。最后是产能的可复制性——只要你的工作流稳定批量产出就是个体力活这在内容赛道上是很可怕的竞争力。当然有朋友会说“AI生成的东西质量行不行”。坦诚讲如果拿它跟《雾山五行》这种级别的二维动画比差距还是很明显的。但漫剧的核心不是画面炫技而是“低成本地把故事讲清楚”。在竖屏短视频的观看场景里观众更在意的是剧情节奏、情绪爆点和更新的稳定性。AI漫画感画风恰好符合这个需求它不需要完全写实也不追求复杂的运镜这就给了AI很大的发挥空间。1.2 为什么我选ComfyUI加minimaxH3这套组合很多人问现在AI视频工具那么多Midjourney、可灵、Runway、Pika为什么我偏要选ComfyUI加minimaxH3本地部署这套组合。我的理由其实很朴素可控性、成本、和流程可复现性。先说可控性。ComfyUI是节点式工作流它最大的优势是“每一步都知道发生了什么”。你可以把“加载图像、应用提示词、生成视频、保存结果”这些节点像搭积木一样连起来每个参数都可以精确控制。这跟网页版工具不太一样——网页版相当于一个黑盒你上传图、输入提示词、点生成得到什么就是什么中间过程无法干预也很难批量操作。ComfyUI可以把整个漫剧的生产流程固化成一套工作流文件后面每一集都是套模板角色统一、镜头统一、参数统一。再说成本。如果长期做漫剧每天生成几十个镜头网页版工具的会员费用累积起来并不低。本地部署minimaxH3之后成本大头变成了电费。虽然前期要花时间搞定环境配置但这个投入是一次性的跑通之后长期受益。最后是可复现性。漫剧是一个需要持续更新的内容品类如果你用的是网页版工具哪天模型下线了、参数调整了你的画风就断了。本地部署的工作流是掌握在自己手里的版本、参数、风格都固定哪怕要升级也能做好版本管理。1.3 一条完整的AI漫剧生产链路我把整个流程拆成六个阶段这篇文章后面会逐一展开。剧本先用大语言模型写出漫剧脚本确定主题、角色、核心冲突和每集的剧情起承转合。分镜把剧本拆解成一个个镜头每个镜头对应一段画面描述包括景别、人物动作、镜头运动方向。静帧生成用ComfyUI生成每个镜头的首帧画面这是后续视频生成的基础底图。视频生成把静帧交给minimaxH3做图生视频让画面动起来生成短则3秒、长则5秒的动态镜头。配音给角色配上对白、旁白加上音效和背景音乐。剪辑把动态镜头和音频按分镜顺序拼接加上字幕、转场、调色输出成片。你可能会觉得这流程很长但实际跑起来会越来越快。我现在的完整状态是一个3分钟左右的片子大约需要25到40个分镜镜头从剧本到成片大概两到三天。这个速度在做传统内容的人眼里已经很快了但对AI漫剧来说还有提升空间后期把工作流固化了一两天出一集是可以做到的。2. 环境准备把ComfyUI和minimaxH3装好2.1 ComfyUI安装小白直接上整合包我先说结论如果你是第一次接触ComfyUI别去折腾手动部署直接用秋叶的一键整合包。这个整合包把Python环境、依赖库、常用插件都打包好了下载解压就能用极大减少了入门阶段的环境折磨。为什么我说新手别手动装因为ComfyUI本身的架构很清晰但它依赖的PyTorch、CUDA、torchvision、各种自定义节点之间是有版本匹配关系的。手动部署最常见的坑就是ComfyUI能启动了但minimaxH3需要的某个自定义节点装不上或者版本不兼容直接报错。秋叶整合包虽然也会遇到问题但它的社区用户量大网上能找到大量现成解决方案这比你自己一点点排错要省时得多。整合包安装完双击启动脚本浏览器会自动打开ComfyUI的界面。你看到的那块“画布”就是工作区右侧或顶部是节点面板。首次打开可以先加载一个官方示例工作流熟悉一下节点连线的基本逻辑。ComfyUI的核心操作逻辑就一句话让数据从一个节点流向另一个节点图像进、图像出中间经过各种处理。2.2 minimaxH3本地部署注意事项minimaxH3是MiniMax开源的视频生成模型支持图生视频和文生视频。本地部署的意思是把模型权重下载到自己的机器上运行画面数据不用上传到别人的服务器既不泄露素材也不用排队等服务器资源。部署前先检查你的硬件。显卡显存是最大的门槛minimaxH3的完整版对显存要求还是不低的。我实测8G显存跑起来比较吃力12G以上体验才会好一些。如果你是24G显存的卡恭喜你基本可以放开跑。硬盘也要留足空间模型文件加缓存建议预留30G以上。部署的主要工作是两件事第一下载模型权重文件放到ComfyUI的models目录下对应的文件夹里第二安装ComfyUI中接入minimaxH3的自定义节点。自定义节点安装方式有两种一种是通过ComfyUI Manager的节点浏览器直接搜索安装另一种是手动把仓库克隆到custom_nodes目录。推荐用ComfyUI Manager它会在节点列表里显示点一下就能装方便管理版本。装完之后最稳妥的验证方法是找一个图生视频的示例工作流加载进去检查模型节点有没有正常显示minimaxH3的模型文件。能正常显示说明基础部署没问题。2.3 显存不够怎么救剪枝LoRA与加速策略如果你的显卡不是顶配也不用直接放弃。社区里针对minimaxH3做了很多优化最常见的就是剪枝版LoRA和加速LoRA。先说剪枝版LoRA。它的思路是原始模型里有很多参数对生成结果的影响很小剪枝就是把这些冗余参数去掉只保留核心部分模型体量小了显存占用自然就降下来了。代价可能是极端情况下的画面细节有所损失但对漫剧这种“中等画质够用”的场景来说画质损失通常是可接受的。再说是“加速LoRA爆显存”的问题。很多朋友遇到过这种情况加了加速LoRA之后生成速度快了不少但显存反而爆得更厉害了。原因是加速LoRA在推理时会引入额外的计算路径如果你的显卡显存本来就贴在及格线上那点额外开销就是压垮骆驼的最后一根稻草。解决办法是配合基础分辨率一起调整30秒的视频改成15秒480p先跑通再考虑720p。我自己的经验是12G显存尽量用剪枝版模型加适度分辨率16G显存可以尝试完整版中高分辨率24G以上就基本不用操心这些问题了。如果你只有8G显存也不是完全没法玩但建议优先考虑云端GPU方案或者把分镜设计得简单一些多用中景和特写少做大场景的复杂运动。2.4 导演台、skill和提示词模板装在哪热搜里频繁出现“minimaxH3导演台”“提示词skill”“提示词模板”这些词我挨个讲一下它们是什么、有什么用、装在哪。导演台是minimaxH3配套的可视化调度模块作用类似给导演看的分镜管理面板。你可以在里面批量管理镜头、组织素材、预览草稿不用在ComfyUI和文件管理器之间来回切换。如果你打算规模化生产漫剧这个工具值得花时间研究。skill和提示词模板本质上是同一件事的两层skill是“告诉AI如何输出规范提示词”的方法提示词模板则是具体的例句库。因为漫剧需要大量同一风格、同一角色的镜头如果每次提示词都靠手打不仅慢还容易出现风格漂移。把提示词写成模板或者让AI用skill来生成标准格式的提示词能很大程度保证角色一致性和画风统一。这些通常以文本文件或插件形式存在放在ComfyUI的custom_nodes或提示词插件目录下。严格来说它们不参与模型计算是辅助你组织生产流程的工具越早规范越好。3. 实战从剧本到视频的完整制作3.1 剧本生成先给AI立好人设和故事框架很多人做AI漫剧的第一个误区是直接让AI“写个故事”。这种问法得到的剧本往往是散乱的、缺乏冲突的流水账。我的做法是先和AI立好人设和框架再让它去写剧情。具体来说先写“世界观设定”和“人物设定”。比如主角的身份、性格、说话风格、表面欲望和深层缺陷配角与主角的关系反派的目标是什么。这些设定文件建议单独存下来因为写分镜和配音脚本的时候都要反复参照。然后让AI基于你给的设定生成一个“单集结构”。漫剧的单集结构跟传统短剧不完全一样因为它的单集时间短可能只有一到三分钟。它更强调“快速进入冲突、结尾留钩子”。我给AI的标准格式是开场定调前10秒→抛出冲突10到40秒→升级对抗40到70秒→情绪爆点最后20秒→悬念钩子最后3秒。等到剧本出来之后别急着进分镜。先通读一遍把对白精简。AI生成的剧本往往带有明显的话痨倾向放在漫剧里会显得节奏拖沓。我的经验是每句对白再压缩20%到30%把表达空间留给画面和表情。3.2 分镜拆解把文字翻译成镜头语言分镜是漫剧制作中最考验功力的环节。AI能帮你把文字变成画面但“这段文字对应什么画面”需要人来判断。拿到剧本后我习惯先把每一场戏标出“景别”和“运镜方向”。景别分为远景、全景、中景、近景、特写。远景用来交代环境和人物关系中景偏重对白交流特写用来给情绪特写、眼神戏、关键道具。运镜方向分为推、拉、摇、移、跟随以及静态镜头。给分镜阶段定好这些方向后面在minimaxH3里设置运动强度时才不会手忙脚乱。比如一句台词“她终于放下防备笑了”如果想表达情绪的释放最好用近景或特写镜头微微推进从面无表情到轻轻一笑。如果你随手分配一个远景那观众什么都看不到。分镜的本质就是“把剧本的情绪立体化”这句台词的情绪点在面部微表情你就得用特写给到脸上。分镜脚本我建议写成表格形式每一行是一个镜头列出镜头编号、景别、画面内容、对白、字幕、预计时长。这样一份表格既是生成素材的指导文档也是后期剪辑的时间轴草稿。3.3 静帧生成一套工作流批量出图静帧是每个分镜的首帧画面它是视频生成的基础。静帧的质量直接决定了视频的下限所以这一步不要偷懒。我在ComfyUI里的常用工作流是加载大模型 → 输入正向和负向提示词 → 设定采样器和步数 → 生成图像 → 保存到指定文件夹。漫剧项目建议竖屏9比16比例高清标准可以设768乘1344或832乘1216这是目前AI绘画对竖屏支持比较成熟的尺寸区间。这里我要特别提一下“统一角色”的问题。漫剧是连续叙事同一个角色需要在几十个分镜里保持脸型、发型、服装一致。最稳妥的方案是为每个主要角色训练一个LoRA。当然零基础小白也可以先用一段“角色锚定提示词”把角色的五官、发型、服装、气质写成固定描述每次出图都复制到正向提示词里。虽然一致性不如LoRA那么稳定但对新手入门来说成本更低。批量出图时我的习惯是固定seed值。seed值相当于随机生成的种子固定seed可以让画面在相近条件下保持构图和风格稳定。每个镜头先出6张左右候选图挑最满意的一张进入下一步。批量出图可以在ComfyUI里做一个“图像批量生成”的流程节点一次把分镜表里所有镜头的首帧全跑出来省去一个个设置的麻烦。3.4 图生视频minimaxH3关键参数解析静帧选好之后进minimaxH3做图生视频。这一步是全流程的技术核心参数直接决定视频观感。先说最基础的设置。图像输入选择刚才生成好的静帧图提示词部分写“镜头运动”的描述例如“镜头缓慢推向人物面部人物嘴角微微上扬”。帧数和每秒帧率决定时长我常用的组合是8到12fps30到60帧对应3到5秒的镜头。漫剧的单个镜头不宜过长超过5秒观众容易疲劳剪辑时也不好接。然后我要重点讲两个关键参数运动强度和噪声强度。运动强度控制画面变化幅度的上限值越高画面动态越大但变形和崩坏的风险也越高。我跑下来的经验是0.4到0.6之间最稳既能看出动态又不容易出现五官漂移。噪声强度控制画面在“原有静帧基础上的变化程度”其实就是给AI多大的改动权限。噪声强度太低画面基本不动跟放了一张静态图没区别噪声强度太高人就不像原来那个人了。新手可以从低值开始一点点往上加。步数和CFG提示词引导系数也要提一下。步数决定采样精细度20到30步是比较通用的范围太少了画面粗糙太多了浪费算力。CFG控制提示词对画面的引导强度过高的CFG会让画面“用力过猛”出现色彩失真和轮廓过渡锐化的问题3到5是比较安全的选择。视频生成是个反复试错的过程。我第一批跑出来的镜头经常有各种问题人物眨眼不够自然、镜头运动幅度忽大忽小、画面边缘出现奇怪的变形。不用气馁这些都属于正常现象。我现在的策略是先把所有镜头跑一版粗稿筛掉明显崩坏的留下有潜力但在细节上有问题的然后针对性地调运动强度和噪声强度单独重跑。4. 配音和剪辑把素材拼成成品4.1 配音让角色真的“开口说话”视频画面有了接下来是声音。漫剧是给人物配对白的没有对白的片子看起来就像“高级PPT”情绪传达大打折扣。配音方案有几个选择第一种是用TTS文本转语音工具输入对白文本它就生成语音文件。现在主流的TTS工具在中文发音和情绪表达上都比较自然了选择不同的音色可以区分角色男声女声、少年老年都可以配置。第二种是用真人录音如果你是个人创作者而且想突破AI味自己录音或者找朋友帮忙录是最好的选择。第三种是混合方案重要角色用真人配角用TTS。新手比较常见的问题是“所有角色用同一个音色”。这会让观众分不清谁在说话观感很差。至少要给主角和反派各分配一个音色女角色用女声男角色用男声这样对话才有辨识度和层次感。音频对齐也是个细节活。截取视频中适合插入对白的时间段让对白的起点和角色开口的帧对齐。AI视频的人脸口型不一定完全贴合语音这是目前技术瓶颈但漫剧本身是偏漫画感的只要对白时间卡在画面切换附近观众不会觉得太违和。背景音乐和音效也有点讲究打斗戏加撞击声紧张段落加心跳声情绪爆点加鼓点这些能显著提升成片的质感。4.2 剪辑把碎片拼成一条能发的片剪辑这一步不一定需要复杂的剪辑软件剪映、必剪、CapCut这类工具就能满足AI漫剧的剪辑需求。我的剪辑流程是这样的按分镜表顺序把视频素材拖进时间轴先不管细节把所有镜头按故事顺序排好然后铺配音把对白放到对应的时间段上接着调整每个镜头的长度去掉前后多余的帧让节奏跟对白匹配再添加字幕字幕位置一般放在画面下方三分之一的安全区内。这里注意AI视频的长宽比偶尔会有黑边或者比例异常需要在剪辑软件里统一裁切。转场效果我建议克制使用。漫剧的镜头切换本来就偏快转场太多反而显得花哨。我常用的只有两种硬切和淡入淡出。普通镜头之间硬切情绪转换时用一点淡入淡出已经足够。调色上可以根据剧情基调加一点色调滤镜比如悬疑剧偏冷、爱情剧偏暖但不要加过度。字幕是漫剧的刚需。短视频平台大多是静音播放起步字幕是否清晰直接决定留人率。字要大要有描边背景不要花哨不要遮挡人脸关键部位。我的习惯是字幕字号设置在画面宽度的1/15左右描边和阴影加足保证在各种手机上都能看清。4.3 成片发布前的最后几步成片导出之前我习惯做一个完整的三轮检查。第一轮检查故事逻辑单集剧情有没有断层角色行为是否符合设定结尾钩子是否足够强。第二轮检查技术瑕疵有没有明显的画面崩坏、重影、比例异常有没有音画不同步。第三轮检查平台规范竖屏比例是否达标字幕是否会被平台界面遮挡。平台的封面和标题也很关键。漫剧的封面可以是本集最有冲击力的一帧配上标题文字比如“她转身的那一刻天塌了”这类情绪向标题对点击率有明显帮助。标题要短、直接、带钩子不要用“第XX集”这种干燥的格式如果平台要求标注集数把序号放在标题尾部即可。5. 新手最容易踩的坑和排查方法5.1 “minimaxH3一直有个女声”是什么情况有用户反馈说跑minimaxH3时生成的视频里“一直有个女声”。我在本地部署时也遇到过类似的问题当时第一反应是程序出Bug了后来排查发现主要有两个来源。第一个来源是模型默认的音频生成模块。minimaxH3本地部署时会附带一个音频或TTS相关的组件如果你在工作流里不小心接入了一个“自动生成旁白”的节点它就会默认生成一段语音而且默认音色往往就是女声。解决方法是检查工作流里有没有挂音频生成的节点如果有关闭或者把“是否生成音频”的参数改成禁用。第二个来源是提示词里写了与声音相关的描述。比如提示词里有“她说”“女声”“旁白”等词汇一些多模态模型会误以为你需要在视频里合成说话声音于是就默认配了一段女性语音。这不是bug而是提示词引导的结果。解决办法是把这类描述词从生成提示词里去掉对白放到配音环节而不是让视频模型直接生成。如果你确认节点和提示词都没问题但还是有声音那就检查minimaxH3的模型配置文件里有没有被预设开启音频输出。这个选项一般叫“enable_audio”或类似名字改成关闭即可。5.2 爆显存和虚拟内存怎么调“爆显存”几乎是本地部署AI的新手必经之路。跑minimaxH3时如果你的显存被占满程序会直接报错或者画面卡死严重时电脑蓝屏。我先说两个最简单的应急方法一是降低视频分辨率从720p降到480p显存开销会肉眼可见地降下来二是减少帧数把60帧改成30帧生成时长减半显存压力也会降很多。如果你的工作流里挂了多个模型也要注意显存资源分配。ComfyUI默认会在切换模型时把之前的模型从显存中卸载但在某些自定义节点的加持下模型可能没有真正卸载多个模型同时占显存自然就爆了。解决办法是在ComfyUI设置里检查“自动释放显存”的相关选项或者手动断开不用的模型节点。虚拟内存是一项容易被忽略的底层设置。当你显存不够时系统会用内存和硬盘空间当作“假显存”来兜底。跑大型视频生成时把虚拟内存设置到32G以上能减少不少“out of memory”报错。设置方法是在Windows的“高级系统设置——性能——高级——虚拟内存”里把自定义大小调大推荐最小16G、最大32G甚至更高。注意虚拟内存不能完全替代显存速度差距明显但它能让流程在显存临界状态下继续跑下去。5.3 Mac到底能不能部署minimaxH3很多用Mac的朋友在犹豫要不要入坑我直接说结论能跑但要看配置别对速度抱太高期望。Mac的M系列芯片有统一内存架构可以把内存当显存用所以在内存充足的情况下跑minimaxH3是可行的。我建议至少16G内存起步32G以上体验会更好。跑还是能跑的但是速度上相比N卡还是有差距。如果你只是想试试效果16G内存的M系列机器可以跑低分辨率、短时长的方案。真到了每天量产几十个镜头的强度Mac的算力会比较吃力。如果你手头只有Mac我的建议是先用低分辨率跑通流程把工作流掌握熟练等后续有预算再配置一台Windows加N卡的机器用来生产。工欲善其事必先利其器这话在AI漫剧的批量生产阶段体现得格外明显。5.4 常见问题速查表我把实际操作中遇到的高频问题整理成了一张速查表方便你排查时快速定位。问题现象可能原因解决办法生成视频里自带女声旁白工作流挂了自动音频节点或提示词含语音描述检查并关闭音频生成节点去掉提示词中的语音/说话词加速LoRA后直接爆显存附加计算路径加剧显存占用降低分辨率或帧数回退剪枝版本模型模型加载后报错缺少文件权重文件没放到指定models目录重新核对models路径和文件名画面大面积变形、五官漂移运动强度或噪声强度过高把运动强度降到0.4到0.5噪声强度逐档下调重新测试生成的视频像静图噪声强度过低或提示词缺少运镜描述提高噪声强度提示词中写明镜头运动方向虚拟内存不足报错系统虚拟内存太小在系统设置中调大虚拟内存至32G以上角色在不同镜头长得不像提示词不一致或缺少LoRA固定角色描述模板条件允许时训练角色LoRAComfyUI页面打不开启动失败端口占用或依赖缺失重启启动脚本检查端口监听查看启动日志报错这张表是我自己在项目推进中积累下来的可以说每一个坑都是用时间换来的。如果你遇到计划之外的新问题第一反应不要“盲改参数”先看ComfyUI的启动日志和节点报错信息日志里通常会给出具体的错误指向再去搜索引擎搜对应报错效率会高很多。6. 我的实操心得几条掏心窝的建议流程和技术写完之后最后分享几条我自己在整个项目中的体会。第一批量思维要早点建立。AI漫剧是规模化的内容生意不是手工活。如果你的目标是一周一更那就把剧本、分镜、出图、跑视频、配音、剪辑都做出模板。ComfyUI的核心竞争力就在这里一条工作流做完后面每集都复用它。模板化看起来前期慢一点但后面的提速是指数级的。第二不要一开始就追求完美。我第一个片子现在回头看槽点密密麻麻。但这没关系先做出一条完整的东西比什么都重要。完片率是新手最大的门槛你只有把全流程走一遍才知道哪个环节是自己真正的瓶颈才能针对性地去解决。反过来如果你天天在研究“怎么让画面更完美”可能三个月过去了一条成片都没发出来。第三编剧能力比技术能力更值钱。我们聊了很多ComfyUI、minimaxH3的参数和节点但漫剧最终拼的是讲故事的能力。同样的工具有人做出来的片子播放量百万有人做出来流量个位数差距几乎都在剧本和分镜上。当你工具熟练之后建议把更多时间拿去拆解优秀短剧的结构研究为什么观众会在某个点留下来、在哪个点划走。持续的编剧能力提升才是这个赛道的真正壁垒。第四账号运营的节奏要稳定。AI漫剧不是拍一部电影它更像连载漫画。更新频率、故事连贯性和人设稳定性都会影响粉丝留存。我的建议是开更之前先囤三到五集给自己留足缓冲时间避免中途断更导致用户流失。稳定输出带来的平台推荐权重往往比单条爆款的突然性更重要。我目前最深的感受是AI漫剧的红利期还在但窗口不会一直敞开。真正跑通全流程的人目前还不算多愿意持续创作内容的人更少。这篇文章把我的方法和踩坑都摆在明面上了剩下的事情就是打开ComfyUI把第一个镜头跑出来。你先完成它再谈优化。