
1. 为什么我要折腾一条 AI 短剧生产线去年年底我刷到一条数据说某平台短剧频道的日均上传量已经突破六位数但真正能跑出播放量的不到百分之三。这个数字背后藏着一个很现实的问题绝大多数创作者卡在的不是创意而是产能。一个五分钟的短剧从写剧本、拆分镜、生成画面、配音配乐到剪辑合成纯手工做下来少说两天多则一周。你辛辛苦苦做一集别人已经发了十条算法凭什么把流量给你。我自己的情况更典型。手头有三个短剧账号在跑团队就我和一个兼职剪辑。之前用传统流程一个月最多产出八到十条累得半死不说质量还忽高忽低。后来我开始琢磨能不能把整条链路拆开用 WorkBuddy 这个智能工作台把重复劳动全部自动化人只负责最核心的创意决策和终审。折腾了大概三周踩了无数坑终于跑通了一条从剧本到成片的六步流水线。现在同样的时间我能稳定产出四十条以上而且每条的质量下限被拉得很高。这篇文章就是把这套流程完整拆给你看。不管你是刚入门的短剧小白还是已经在做但想提效的老手只要你会打字、能看懂基本的配置逻辑就能照着复现。我会把每一步的提示词模板、参数设置、自动化配置都写清楚包括我踩过的那些坑和后来找到的绕行方案。WorkBuddy 的 skill 机制、自定义指令、跨对话记忆这些功能我会重点讲因为它们才是让整条线真正“自动”起来的关键。2. 整条生产线的架构设计与工具选型2.1 为什么选 WorkBuddy 而不是纯手动或单一工具市面上做 AI 短剧的工具我基本试了个遍。有的专攻画面生成有的只做配音还有的号称“会打字就能生成”的全自动工具。但实际用下来单一工具的通病是你没法控制中间环节。比如某个全自动工具确实能一键出片但剧本逻辑稀碎、分镜跳来跳去、角色长相每集都不一样。你想改对不起改不了只能重新生成抽卡一样碰运气。WorkBuddy 吸引我的地方在于它的定位——它不是某个单点工具而是一个可以编排多个能力的工作台。你可以把它理解成一个“AI 流水线的调度中心”剧本生成、分镜拆解、画面描述、配音文案、剪辑指令全部通过 skill 和自定义指令串起来。每个环节的输出都能被下一个环节消费而且你可以在任意节点插入人工审核。这种“半自动”的架构比全自动更可控比纯手动快十倍。另一个关键因素是 WorkBuddy 的跨对话记忆 skill。短剧最怕角色前后不一致第一集女主是长发圆脸第三集变成短发尖脸观众直接出戏。跨对话记忆能把角色设定、世界观、前情提要持久化存储每次生成新内容时自动带上这些上下文。这个功能在纯手动流程里需要你自己维护一个设定文档每次复制粘贴费时费力还容易漏。2.2 六步流水线的整体架构整条线我拆成六个环节每个环节对应一个 WorkBuddy 的 skill 或自定义指令组步骤环节名称核心任务输出物人工介入程度1剧本生成根据题材和设定生成分集剧本结构化剧本文档高需审核修改2分镜拆解把剧本拆成可执行的镜头列表分镜表含画面描述中抽查关键镜头3画面生成根据分镜描述生成图片或视频片段素材文件夹低批量生成后筛选4配音配乐生成对白音频和背景音乐音频文件低试听后微调5剪辑合成按分镜顺序拼接素材粗剪视频中调整节奏6终审发布检查成片质量并导出成片高最终把关这个架构的核心逻辑是把“创意密集型”和“劳动密集型”的工作分开。剧本和终审是创意密集的必须人来主导分镜拆解、画面生成、配音、剪辑是劳动密集的交给自动化。中间设置审核点确保自动化跑偏时能及时拉回来。2.3 自动化配置的底层逻辑WorkBuddy 的自动化靠三样东西支撑skill、自定义指令、工作流编排。skill 是预置的能力模块比如文本生成、图像生成、文件读写自定义指令是你给 AI 定的规则比如“所有剧本必须包含三幕结构”“分镜描述必须包含景别和运镜”工作流编排是把这些串起来的胶水。我一开始犯的错是贪多想把所有环节塞进一个工作流里一键跑完。结果就是中间任何一步出问题整个流程崩掉排查起来极其痛苦。后来改成“分段自动化”每个环节独立成一个可重复执行的任务上一步的输出作为下一步的输入。这样某一步需要重跑时不影响其他环节。这个思路的转变是我觉得整条线能稳定跑起来的最关键决策。3. 核心环节的提示词工程与实操细节3.1 剧本生成如何让 AI 写出能拍的本子剧本是一切的起点。AI 写剧本最大的问题是“看起来像剧本但拍不出来”。比如它会写“两人在咖啡馆激烈争吵”但没写咖啡馆什么风格、两人穿什么、争吵时有没有摔东西。这种描述给到分镜环节分镜师不管是人还是 AI只能瞎猜。我的解决方案是在剧本生成阶段就强制结构化。通过 WorkBuddy 的自定义指令我给剧本生成 skill 定了三条硬规则每集必须包含明确的场景列表每个场景标注时间、地点、氛围每段对白必须附带角色情绪和动作提示每集结尾必须留钩子且钩子类型不能重复提示词模板我打磨了十几版最终稳定下来的是这个结构你是一位擅长[题材]短剧的编剧。请根据以下设定生成第[N]集剧本。 【世界观设定】 [粘贴跨对话记忆中的世界观] 【角色设定】 [粘贴角色档案含外貌、性格、说话风格] 【前情提要】 [粘贴上一集结尾的钩子] 【本集要求】 - 时长控制在[X]分钟 - 必须包含[数量]个反转 - 结尾钩子类型[悬念/冲突/情感冲击] - 场景数量[数量] 【输出格式】 场景一 时间 地点 氛围 画面描述 对白 [角色名]情绪/动作台词 ...这个模板的关键在于“输出格式”部分。你给 AI 的格式越具体它返回的内容越可用。我试过只写“生成剧本”返回的是小说体写了输出格式后返回的直接就是分镜师能看懂的结构。注意剧本生成后一定要人工过一遍。AI 容易犯的错包括角色名字前后不一致、时间线混乱、对白过于书面化。我一般会重点检查对白把“我认为我们应该……”改成“咱俩得聊聊……”口语化程度直接决定观众代入感。3.2 分镜拆解从文字到画面的翻译器分镜拆解是整条线里技术含量最高的环节。它要做的是把剧本里的文字描述翻译成画面生成工具能理解的视觉语言。这里涉及一个核心概念提示词工程中的“上下文工程”。你不能只给 AI 一句“女主在咖啡馆等人”得给它足够的上下文——女主长什么样、咖啡馆什么风格、镜头是近景还是全景、光线是暖是冷。我在 WorkBuddy 里建了一个专门的分镜 skill它的系统提示词是这样的你是一位资深分镜师。请将以下剧本片段拆解为分镜表。 【角色视觉档案】 [从跨对话记忆中调取含每个角色的三视图描述] 【场景视觉参考】 [从场景库中调取含色调、光线、关键道具] 【拆解规则】 1. 每个镜头时长不超过5秒 2. 对话场景必须包含正反打 3. 情绪转折处必须给特写 4. 每个镜头必须标注景别、运镜、画面描述、对白、音效 5. 画面描述必须包含主体、动作、环境、光线、风格 【输出格式】 | 镜号 | 景别 | 运镜 | 画面描述 | 对白 | 音效 | 时长 |这里有个细节值得展开三视图尺寸。很多做 AI 短剧的人会纠结角色三视图的尺寸我的经验是如果你用的是主流图像生成模型三视图建议用 1:1 或 3:4 的比例分辨率至少 1024。太小的图会导致角色特征丢失太大的图生成速度慢且容易崩。WorkBuddy 里可以在 skill 配置中预设输出尺寸避免每次手动调。分镜表生成后我会抽查几个关键镜头。重点看两样一是画面描述是否足够具体二是镜头之间的逻辑是否连贯。如果发现某个镜头描述太模糊我会手动补几句再让 AI 重新生成那一条。这种“局部重跑”的能力是分段自动化的优势。3.3 画面生成批量出图与筛选策略画面生成环节我的原则是“批量生成人工筛选”。一个五分钟的短剧大概需要六十到八十个镜头如果每个镜头都精雕细琢时间根本不够。我的做法是每个镜头生成三到四个版本然后快速过一遍挑最合适的。WorkBuddy 在这里的作用是编排。我建了一个工作流读取分镜表 → 逐条调用图像生成 skill → 按镜号命名保存 → 生成一个缩略图预览页。这个流程跑一次大概二十分钟能产出两百多张图。然后我花十五分钟筛选把可用的挑出来不可用的标记后重新生成。画面描述的质量直接决定出图质量。我在分镜阶段就要求画面描述包含五个要素主体、动作、环境、光线、风格。举个例子女主主体坐在靠窗位置手指无意识地搅动咖啡动作背景是暖黄色灯光的复古咖啡馆窗外有雨环境侧光从左侧打入面部有柔和阴影光线电影感写实风格浅景深风格。这种描述给到图像生成模型出图合格率能到七成以上。如果只写“女主在咖啡馆”合格率不到三成。实操心得角色一致性是 AI 短剧最大的痛点。我的解决方案是在跨对话记忆里存每个角色的“视觉锚点”——一段固定的外貌描述每次生成画面时自动附加。另外同一个角色的所有镜头尽量用同一个随机种子这样面部特征会更稳定。WorkBuddy 的 skill 配置里可以固定种子参数这个一定要设。3.4 配音配乐让声音为画面加分配音环节我走过弯路。一开始用默认的 TTS 语音出来的效果像新闻播报跟短剧的调性完全不搭。后来我调整了策略对白用带情绪的语音合成旁白用另一种音色背景音乐根据场景氛围从音乐库匹配。WorkBuddy 里我配了两个 skill一个负责对白合成一个负责背景音乐匹配。对白合成的提示词里我会标注每句台词的情绪标签比如“愤怒”“哽咽”“冷笑”语音合成引擎会根据标签调整语调。背景音乐匹配则是根据分镜表里的“氛围”字段从预设的音乐库里选曲。这里有个容易忽略的点音画同步。短剧的节奏感很大程度上取决于声音和画面的配合。我的做法是在分镜阶段就标注每个镜头的“音效”字段比如“关门声”“雨声”“心跳声”剪辑时直接按标注插入。这样比后期凭感觉配效率高得多。3.5 剪辑合成自动化粗剪与人工精修剪辑环节我用 WorkBuddy 做粗剪输出一个按分镜顺序拼接的版本然后人工精修。粗剪的自动化逻辑很简单读取分镜表 → 按镜号顺序拉取画面素材 → 按标注时长裁剪 → 叠加对白音频 → 插入音效和背景音乐 → 输出工程文件。这个粗剪版本大概能完成百分之七十的工作量。剩下的百分之三十是人工精修主要包括调整镜头节奏有些镜头需要加速或减速、添加转场效果、调色、加字幕。这些工作目前 AI 还做不好必须人来判断。注意粗剪输出的工程文件格式要和你常用的剪辑软件兼容。WorkBuddy 支持导出多种格式我一般用 XML 格式导入剪辑软件后轨道和标记都保留着省去重新对齐的麻烦。3.6 终审发布质量把关的最后一关终审环节我会完整看一遍成片重点检查四样剧情逻辑是否通顺、角色形象是否一致、音画是否同步、有没有明显的 AI 生成瑕疵比如手指变形、文字乱码。发现问题就回到对应环节重跑因为整条线是分段自动化的重跑单步成本很低。发布前的元数据我也用 WorkBuddy 自动生成标题、简介、标签、封面图。封面图从成片里截取最有冲击力的帧加上标题文字。这些琐事自动化后每条视频的发布准备时间从二十分钟压缩到三分钟。4. 自动化配置的核心skill、指令与工作流4.1 WorkBuddy skill 的配置逻辑Skill 是 WorkBuddy 的能力单元。你可以把 skill 理解成一个“函数”输入特定格式的数据输出特定格式的结果。整条生产线我用了六个核心 skill剧本生成 skill输入题材、设定、前情输出结构化剧本分镜拆解 skill输入剧本片段输出分镜表画面生成 skill输入画面描述输出图片文件语音合成 skill输入对白文本和情绪标签输出音频文件音乐匹配 skill输入氛围标签输出背景音乐文件剪辑编排 skill输入分镜表和素材路径输出粗剪工程文件每个 skill 的配置里最关键的是系统提示词和输出格式约束。系统提示词决定 AI 的“角色认知”输出格式约束决定结果能不能被下一个环节消费。我踩过的坑是早期没做输出格式约束AI 返回的内容格式五花八门下游 skill 解析不了整条线断掉。后来我给每个 skill 都加了严格的 JSON 或表格格式要求问题才解决。4.2 自定义指令给 AI 定规矩WorkBuddy 的自定义指令功能可以让你给所有任务设定全局规则。我定了这么几条所有输出必须使用中文专业术语保留英文原文所有涉及角色的描述必须与跨对话记忆中的角色档案一致所有时间、地点、数字必须明确禁止使用“某天”“某个地方”这类模糊表述所有对白必须口语化禁止书面语所有输出必须附带一个“置信度”评分低于 0.7 的结果我会人工复核这几条规则看似简单但效果立竿见影。尤其是“置信度”评分让 AI 自己评估输出质量我只需要看低分项审核效率提升了一倍。4.3 跨对话记忆角色一致性的守护者跨对话记忆 skill 是我认为 WorkBuddy 最有价值的功能。它本质上是一个持久化的上下文存储每次新对话开始时自动加载。我在里面存了三类信息角色档案每个角色的外貌、性格、说话风格、视觉锚点世界观设定故事发生的时代、地点、核心规则前情提要已发布剧集的剧情摘要和结尾钩子有了这个我生成第十集剧本时AI 自动知道第一集发生了什么、角色长什么样、世界观有没有特殊规则。不需要我每次手动粘贴设定文档也不会出现前后矛盾。实操心得跨对话记忆的内容要定期清理和更新。我每周会花十分钟回顾一下把过时的设定删掉把新出现的角色加进去。记忆库太臃肿会影响加载速度太陈旧会导致 AI 引用错误信息。4.4 工作流编排把 skill 串起来工作流编排是整条线的“胶水”。WorkBuddy 的工作流编辑器支持拖拽式编排你可以把 skill 按顺序连接设置输入输出映射添加条件分支。我的主工作流是这样的开始 → 加载跨对话记忆 → 剧本生成 skill → 人工审核节点 → 分镜拆解 skill → 画面生成 skill → 语音合成 skill → 音乐匹配 skill → 剪辑编排 skill → 输出粗剪 → 结束人工审核节点是关键。它让工作流暂停等我确认剧本没问题后再继续。如果剧本需要修改我直接改完再点继续后面的环节自动用新版本跑。这种“人在回路”的设计比全自动可靠得多。5. 常见问题与排查技巧实录5.1 角色形象前后不一致怎么办这是最高频的问题。我的排查顺序是先检查跨对话记忆里的角色档案是否完整再检查画面生成时是否附加了视觉锚点最后检查随机种子是否固定。三个都确认后如果还不一致就在画面描述里增加更具体的特征描述比如“左眼角有一颗泪痣”“永远穿红色外套”。5.2 分镜表生成后画面描述太模糊这说明分镜 skill 的系统提示词不够具体。我的解决方案是在提示词里加入“五要素检查清单”要求 AI 在输出每个镜头前自检主体写了吗动作写了吗环境写了吗光线写了吗风格写了吗五个都写了才允许输出。5.3 配音和画面不同步这个问题通常出在时长标注上。分镜表里的“时长”字段是估算值实际生成的画面长度可能不一样。我的做法是在剪辑编排 skill 里加一个“时长校准”步骤读取实际素材时长自动调整音频的裁剪点确保对白和口型大致对齐。5.4 WorkBuddy 跑着跑着卡住或报错常见原因有三个一是某个 skill 的输出格式不符合下游要求导致解析失败二是跨对话记忆加载超时三是素材文件路径包含特殊字符。排查时先看日志定位到具体哪个 skill 报错然后检查它的输入输出格式。路径问题最隐蔽建议所有素材文件夹和文件名只用英文和数字。5.5 生成的内容质量不稳定AI 生成本身就有随机性质量波动是正常的。我的应对策略是“批量生成人工筛选”每个环节都生成多个版本挑最好的用。另外把置信度阈值设好低于阈值的结果自动标记优先复核。问题现象可能原因排查步骤解决方案角色脸变了视觉锚点丢失检查跨对话记忆补全角色档案固定种子画面描述模糊提示词缺要素检查分镜 skill 提示词加入五要素检查清单音画不同步时长标注不准对比素材实际时长加时长校准步骤工作流卡住输出格式不匹配查看日志定位 skill统一输出格式为 JSON质量波动大随机性导致检查置信度评分批量生成人工筛选6. 我在这条线上踩过的坑和总结的经验先说一个最反直觉的体会自动化程度越高人工审核越重要。我一开始追求“一键出片”把所有环节都设成自动通过结果产出的东西根本没法看。后来改成每个关键环节都设审核点虽然多花了几分钟但成片合格率从不到两成提升到七成以上。AI 是放大器你给它好的输入它放大好你给它模糊的指令它放大混乱。另一个坑是过度优化单个环节。有段时间我沉迷于调画面生成的提示词想把出图合格率从七成提到九成。花了整整一周提升到七成五边际效益极低。后来我把精力转到分镜拆解环节把画面描述写得更具体出图合格率直接跳到八成五。这让我明白整条线的瓶颈往往不在你最关注的那个环节而在它的上游。关于 WorkBuddy 的使用我的建议是先把单个 skill 跑通再串工作流。很多人一上来就搭复杂的工作流结果某个 skill 配置有问题整条线跑不通排查起来极其痛苦。正确的顺序是单独测试剧本生成 skill确认输出格式稳定再测试分镜拆解 skill确认能消费剧本输出以此类推最后再串起来。最后分享一个提效小技巧把常用的提示词模板存成 WorkBuddy 的“指令片段”需要时直接调用不用每次重新写。我存了大概二十个片段覆盖剧本生成、分镜拆解、画面描述、配音标注等场景。这个习惯让我每天至少省下半小时的重复输入时间。这套流程我跑了三个月累计产出四百多条短剧账号粉丝从零涨到二十多万。中间迭代了无数版配置现在算是稳定下来了。如果你也在做类似的事情希望这些经验能帮你少走点弯路。