
1. 为什么文生视频的提示词值得单独拿出来讲过去一年我花了不少时间在文生视频这条线上折腾从最早拿Runway跑几秒的片段到后来用可灵做分镜预演再到本地用ComfyUI搭工作流跑MiniMax H3踩过的坑比跑出来的成片还多。有个很直观的感受同一个模型同一段素材需求提示词写得好和写得烂出来的东西完全是两个物种。图片生成时代大家已经接受了“提示词工程”这个概念但视频生成对提示词的要求比图片高出一个量级——因为你要控制的不只是一帧画面还有时间维度上的运动、镜头、节奏和一致性。这篇内容就是把我自己在MiniMax、可灵、ComfyUI、Runway这几个平台上反复验证过的提示词写法整理出来。不管你是刚接触文生视频、想知道“鹈鹕骑自行车”这种测试提示词到底该怎么写还是已经在本地部署MiniMax H3、被clip 5120和4096不匹配的问题卡住都能在这里找到可以直接抄的模板和排查思路。我尽量不写那种“首先我们要理解AI的原理”的废话直接上结构、上参数、上我实际跑通的例子。先说一个核心判断文生视频的提示词不是“描述画面”而是“导演一段几秒钟的戏”。你写的是给一个执行力很强但完全没有常识的摄影师看的拍摄脚本他需要知道镜头怎么动、主体做什么、环境什么状态、光线从哪来、节奏是快是慢。把这几个维度拆开提示词就有了骨架。2. 文生视频提示词的底层结构拆解2.1 从“画面描述”到“时间脚本”的思维转变很多人写视频提示词的习惯是从图片提示词直接搬过来的比如“一只鹈鹕骑着自行车经过海边夕阳电影感”。这句话丢给图片模型能出不错的图但丢给视频模型大概率会得到一个主体模糊、运动诡异、镜头乱晃的几秒片段。原因很简单视频模型需要知道在时间轴上发生了什么变化。我习惯把一条完整的视频提示词拆成五个模块主体与动作、镜头语言、环境与光线、风格与质感、节奏与时长。这五个模块不是必须按顺序写但写之前脑子里要过一遍缺哪个补哪个。拿“鹈鹕骑自行车”这个经典测试案例来说如果只写“鹈鹕骑自行车”模型不知道鹈鹕是站着骑还是坐着骑、自行车是静止还是前进、背景是白天还是夜晚、镜头是跟拍还是固定。补全之后大概是这样的一只白色鹈鹕坐在一辆复古红色自行车上双翅握住车把双脚踩踏板自行车沿海边公路匀速前进镜头从侧面中景跟拍夕阳逆光海面有金色反光电影质感浅景深画面稳定时长5秒。这段话里“匀速前进”是运动描述“侧面中景跟拍”是镜头语言“夕阳逆光”是光线“电影质感、浅景深”是风格“5秒”是时长约束。每个模块都在给模型缩小解空间。2.2 五个核心模块的权重与顺序在实际写的时候顺序会影响模型的注意力分配。我实测下来把主体和动作放在最前面镜头语言紧随其后风格和画质词放最后出片稳定性最高。原因在于当前主流视频模型的文本编码器对开头部分的语义权重更高把最关键的信息前置能减少“主体跑偏”的概率。具体权重我大致排了个序供参考模块建议位置权重感受缺失后果主体与动作开头最高主体变形、动作混乱镜头语言前中段高镜头乱晃、构图失控环境与光线中段中高背景崩坏、光影平淡风格与质感中后段中画面廉价、缺乏统一感节奏与时长结尾中低节奏拖沓或过快这个顺序不是死规矩但如果你刚开始写按这个来能少走很多弯路。等熟练了再根据具体模型微调比如可灵对镜头语言特别敏感可以把镜头描述再提前一点Runway对风格词响应强风格词可以适当加重。2.3 不同模型的提示词“方言”差异这里要重点说一下MiniMax、可灵、ComfyUI、Runway这四个平台对提示词的“理解方式”是不一样的不能一套词走天下。MiniMax H3系列对结构化、带参数感的描述响应更好它有点像在解析一段带标签的指令你写“镜头侧面跟拍运动匀速光线逆光”这种半结构化文本它反而比纯自然语言更稳。可灵则更吃自然语言的长句描述尤其是带情绪和氛围的词比如“温暖的黄昏光线洒在……”它会把这种氛围感做进画面里。Runway对简洁、动词驱动的提示词响应最好写太长反而会稀释关键信息。ComfyUI本身不是模型它是工作流平台提示词最终是喂给背后接的模型比如SVD、AnimateDiff、H3等所以ComfyUI里的提示词写法取决于你接的是哪个节点。我一般会准备两套模板一套“结构化短句版”给MiniMax和ComfyUI一套“自然语言长句版”给可灵和Runway。下面会分别给例子。3. 适配主流平台的提示词模板与实操3.1 MiniMax H3结构化提示词与参数配合MiniMax H3是我在本地部署跑得比较多的一个它的提示词响应有个特点对动作的时序描述很敏感但对过于文学化的修辞不感冒。你写“鹈鹕优雅地蹬着自行车”它可能理解成“优雅”是一种风格而不是动作修饰但你写“鹈鹕双翅握把双脚交替踩踏板自行车向前移动”它就能把动作拆解清楚。我常用的MiniMax H3提示词模板是这样的主体一只白色鹈鹕体型中等羽毛细节清晰 动作坐在红色复古自行车上双翅握住车把双脚交替踩踏板身体随骑行轻微前倾 镜头侧面中景镜头与主体同步匀速移动画面稳定无抖动 环境海边公路右侧是海面左侧是低矮灌木 光线黄昏逆光海面有金色反光主体边缘有轮廓光 风格电影质感浅景深色彩偏暖胶片颗粒感轻微 时长5秒这种写法看起来有点“笨”但实测下来出片率最高。尤其是做参考生视频的时候分镜怎么写直接决定参考图能不能被正确驱动。我的经验是参考图负责“长什么样”提示词负责“怎么动”两者要分工明确。如果你在参考生视频里把外观描述写得太重模型会倾向于保持参考图静止动作就僵住了。关于MiniMax H3生成5秒视频提示词需要多少字这个问题我的实测结论是中文80到150字之间比较合适。低于60字信息量不够主体容易跑偏高于200字模型会开始“抓不住重点”出现动作断裂或者画面元素互相打架。上面那个模板大概120字左右是个比较舒服的区间。还有一个高频问题MiniMax H3量化版clip 5120与4096不匹配。这个报错通常出现在你用的文本编码器版本和模型预期的clip长度对不上。5120和4096指的是clip的上下文长度量化版模型在导出时可能固定了某个长度而你的工作流里加载的clip节点是另一个长度。解决办法是检查ComfyUI里加载clip的节点参数把max_length对齐到模型要求的数值或者换用与量化版配套的clip文件。这个坑我踩过两次第一次以为是显存问题折腾了半天才发现是clip长度不匹配。3.2 可灵自然语言长句与氛围控制可灵的提示词风格和MiniMax完全相反。它更喜欢连贯的、带场景叙事的自然语言你把画面当成一段小说来写它反而能理解得更到位。我写可灵提示词的时候会刻意加入一些氛围词和情绪词比如“温暖的”“静谧的”“略带怀旧感的”这些词在MiniMax里可能被忽略但在可灵里会实打实地影响色调和光影。一个可灵版的“鹈鹕骑自行车”提示词黄昏时分一只白色的鹈鹕悠闲地骑着一辆红色复古自行车沿着海边公路缓缓前行。它的双翅轻轻握住车把双脚有节奏地踩着踏板身体随着骑行微微前倾。镜头从侧面中景跟随拍摄与鹈鹕保持同步移动画面平稳流畅。夕阳从海面方向逆光照射给鹈鹕的羽毛镀上一层金色轮廓光海面上波光粼粼。整体画面呈现电影般的质感浅景深暖色调带有轻微的胶片颗粒感时长5秒。这段话大概160字比MiniMax版长但可灵吃这一套。注意我在里面加了“悠闲地”“缓缓”“轻轻”“有节奏地”这些副词它们的作用是控制动作的速度和力度。可灵对这类副词响应很好你写“快速冲刺”和“缓缓前行”出来的运动幅度完全不一样。可灵还有一个我特别喜欢的能力对镜头运动的描述很精准。你写“镜头从侧面中景跟随拍摄”它真的会做一个平滑的跟拍而不是随机晃。所以如果你做分镜预演可灵的镜头语言描述可以写得更细比如“镜头先固定第2秒开始缓慢推近”这种带时间点的镜头指令它也能部分响应。3.3 Runway动词驱动与简洁至上Runway的提示词哲学是“少即是多”。它背后的文本编码器对长句的解析能力不如前两者写太长反而会让关键动词被淹没。我写Runway提示词的习惯是一句话说清主体和动作一句话说清镜头再加两三个风格词结束。Runway版A white pelican rides a red vintage bicycle along a coastal road at sunset, pedaling steadily. Side tracking shot, medium shot, stable camera. Cinematic, warm tones, shallow depth of field. 5 seconds.英文大概35个词。Runway对英文提示词的响应比中文好如果你英文还行建议直接写英文。它的强项是运动流畅度和画面稳定性所以提示词里不用太担心“画面稳定”这种词它默认就稳。你更应该把词用在“做什么动作”上比如“pedaling steadily”比“riding a bicycle”更能让它做出踩踏板的动作。Runway有个小技巧用现在分词描述持续动作。比如“pedaling”“moving”“turning”这种进行时态能让模型理解这是一个持续的运动过程而不是一个瞬间姿态。我试过把“pedals”改成“pedaling”踩踏板的循环动作明显更自然。3.4 ComfyUI工作流中的提示词节点与显存优化ComfyUI本身不生成视频它是把各个模型节点串起来的工作流平台。所以在ComfyUI里写提示词本质是在CLIP Text Encode节点里写然后连到采样器。但ComfyUI的特殊之处在于你可以用多个提示词节点分别控制不同阶段比如一个节点控制首帧一个节点控制运动这在做复杂视频时非常有用。我常用的ComfyUI视频工作流大致是加载模型MiniMax H3或SVD→ CLIP文本编码 → 空Latent或参考图 → 采样器 → VAE解码 → 视频合成。提示词写在CLIP节点里格式取决于你接的模型。如果接的是H3就用上面说的结构化写法如果接的是SVDSVD对提示词的响应比较弱更多靠参考图驱动提示词写简洁的动作描述就行。ComfyUI生成视频时爆内存是个高频问题。我遇到过的原因主要有三个一是分辨率设太高二是帧数太多三是模型没做量化。解决办法按优先级排先把分辨率降到512×512或768×768试跑确认能跑通再往上加然后把帧数从25降到16或8最后检查有没有用fp16或int8量化版模型。如果用的是秋叶整合包里面一般已经配好了量化模型和显存优化节点直接跑默认工作流通常不会爆。但如果你自己加了太多节点比如同时挂了多个ControlNet显存就会吃紧。关于ComfyUI秋叶一键整合包我的建议是新手先用它把环境跑通确认显卡驱动、CUDA版本、PyTorch版本都对得上再自己去装插件和模型。秋叶包的好处是省去了配环境的痛苦坏处是有些默认设置比较保守跑大模型会慢。等你熟悉了工作流结构可以自己换更激进的采样器和调度器。还有一个热词里提到的ComfyUI CLIP询问机这其实是指CLIP Text Encode节点。它的作用是把你的文本提示词编码成模型能理解的向量。如果你发现提示词改了但画面没变化大概率是CLIP节点没正确连接或者文本编码器的权重没加载对。检查方法是看节点有没有报红以及采样器的conditioning输入是不是来自CLIP节点。4. 分镜提示词与复杂动作的写法4.1 参考生视频的分镜怎么写参考生视频image-to-video的分镜提示词和纯文生视频不一样。纯文生视频你要描述整个画面参考生视频你只需要描述参考图之外的变化。我见过很多人把参考图里的内容又用文字描述一遍结果模型收到重复信息反而不知道该动还是该静。正确的做法是参考图定外观提示词定运动。比如你有一张鹈鹕站在自行车旁的参考图你想让它骑起来提示词就写鹈鹕跨上自行车双翅握住车把双脚踩踏板自行车开始向前移动镜头侧面跟拍背景从静止变为向后移动。这里完全没有描述鹈鹕的颜色、自行车的款式因为这些参考图已经给了。你只写“跨上”“握住”“踩”“移动”这些动作模型就知道该让哪些部分动起来。分镜的写法我习惯按时间切片来写。一个5秒的视频可以切成3个阶段0-2秒、2-4秒、4-5秒。每个阶段写一个主要动作或镜头变化。比如0-2秒鹈鹕坐上自行车双翅握住车把镜头固定中景。 2-4秒鹈鹕开始踩踏板自行车向前移动镜头开始侧面跟拍。 4-5秒自行车匀速前进镜头保持跟拍画面稳定。这种带时间戳的写法在MiniMax H3和可灵上都能部分生效尤其是MiniMax H3它对时序标签的解析能力比想象中好。Runway对时间戳的响应弱一些但你可以用“then”“after that”这类连接词来暗示顺序。4.2 打斗动作提示词的拆解方法打斗动作是文生视频里最难写的一类因为涉及多个主体的快速交互。热词里提到的“打斗动作提示词skill”我理解成一套拆解方法。我的经验是把打斗拆成“起手-交锋-收招”三段每段只写一个核心动作不要试图在一句话里描述整套连招。比如两个人对打的5秒视频起手左侧人物右拳向前挥出右侧人物身体后仰闪避镜头中景固定。 交锋右侧人物顺势踢腿反击左侧人物抬臂格挡两人位置互换镜头轻微横移。 收招左侧人物后退一步拉开距离右侧人物保持戒备姿态镜头拉远至全景。每段大概20到30字三段加起来不到100字。这样写的好处是模型能逐段解析动作不会因为信息过载而糊成一团。如果你把“左拳右腿格挡闪避反击”全塞在一句话里出来的大概率是两个人原地抽搐。还有一个技巧用方向词代替具体招式。写“向右挥拳”比写“一记摆拳”更有效因为模型对方向词的响应比武术术语强。同理“向左闪避”“向后跳”“向上踢”这些方向加动作的组合出片率最高。4.3 25宫格分镜提示词的批量生成思路热词里有个“生成25宫格分镜提示词软件”这其实是一个很实用的需求把一个长视频拆成25个分镜每个分镜生成对应的提示词。我的做法是用一个模板批量填充而不是靠软件。模板大概是分镜编号{n} 画面内容{主体}{动作}{环境} 镜头{景别}{运动方式} 光线{时间}{光源方向}{氛围} 时长{秒数}然后你只需要把每个分镜的变量填进去。25个分镜的工作量看起来大但如果你先把整个视频的叙事线拉出来每个分镜其实就是在回答“这一秒画面里有什么、在动什么、镜头在哪”。我一般会先用表格把25格列出来填完再转成提示词这样逻辑不会乱。5. 常见问题与排查技巧实录5.1 提示词写了但画面不动怎么办这是最高频的问题。原因通常有三个一是提示词里缺少明确的动作动词二是参考图权重太高压制了运动三是模型本身的运动能力有限。排查顺序先看提示词有没有动词把“鹈鹕在自行车上”改成“鹈鹕踩踏板前进”再看参考生视频里参考图的权重是不是设太高一般降到0.6到0.8之间最后换一个运动能力更强的模型试比如从SVD换到H3。5.2 主体变形和闪烁的抑制方法主体变形通常是因为提示词对主体的描述不够具体模型在运动过程中“忘记”了主体长什么样。解决办法是在提示词里重复强调主体的关键特征比如“白色鹈鹕长喙黑色眼周”这些特征词会在每一帧的生成中被强化。闪烁问题更多是模型层面的提示词能做的有限。你可以试试降低运动幅度把“快速奔跑”改成“缓慢行走”闪烁会明显减少。另外提高帧率也有帮助但会吃更多显存。5.3 显存不足与生成速度的平衡本地跑视频显存和速度永远是一对矛盾。我的经验是先保显存再提速度。显存不够直接跑不起来速度慢还能等。具体做法用量化模型int8或fp16分辨率控制在768以下帧数控制在16到25之间。如果这样还爆就上ComfyUI的显存优化节点或者把工作流拆成两段跑。海光K100这类国产卡跑MiniMax H3的速度我实测过比同价位消费卡慢一些但胜在显存大能跑更高分辨率的视频。如果你手头有这类卡建议把分辨率拉到1024帧数给到25速度虽然慢但画质提升明显。5.4 常见问题速查表问题现象可能原因排查动作画面不动缺动词、参考图权重高加动作动词降参考权重主体变形主体描述不具体重复关键特征词画面闪烁运动幅度大、帧率低降运动幅度提帧率爆显存分辨率高、帧数多、未量化降分辨率减帧数用量化模型clip不匹配clip长度与模型不符对齐max_length换配套clip提示词无效CLIP节点未连接检查节点连接和权重加载动作断裂提示词过长精简到150字以内镜头乱晃缺镜头语言加“固定镜头”或“跟拍”描述6. 我个人的一些实操体会写文生视频提示词这件事说到底是在用文字给模型画一条运动的轨道。你写得越具体模型跑得越稳你留白越多模型就越自由发挥而自由发挥的结果通常不是你想要的。我刚开始的时候总想着“让AI自己发挥”后来发现视频生成和图片生成不一样图片跑偏了还能挑一张好看的视频跑偏了就是几秒钟的废片重跑成本高得多。所以我的建议是前期把提示词写细细到你自己觉得啰嗦的程度。等你对某个模型的脾气摸透了再慢慢做减法。比如我现在用MiniMax H3已经能靠80字左右的提示词稳定出片但这是我跑了上百条废片之后才练出来的手感。新手直接上短提示词大概率会挫败。还有一个我踩过的坑不要在不同平台之间直接复制提示词。MiniMax的结构化模板丢给可灵可灵会觉得太干巴可灵的长句丢给RunwayRunway会抓不住重点。每个平台都有自己的“语言习惯”花点时间分别调教比一套词走天下效率高得多。最后说一个关于本地部署的体会。ComfyUI加MiniMax H3的组合自由度确实高但环境配置和显存优化会吃掉你大量时间。如果你只是想快速验证一个创意先用在线平台跑通提示词确认效果后再搬到本地做批量生成这个流程会顺畅很多。本地部署的价值在于批量、可控和隐私不在于单条视频的生成速度。想清楚这一点你就不会在环境配置上钻牛角尖了。