
简介一份面向AI视频创作者与短视频制作者的AI音乐MV制作全流程参考文档。文档以《只字不提》MV为实战案例讲解如何组合使用DeepSeek、豆包、即梦、剪映四款AI工具解决从歌词提示词优化、画面描述词生成、图片与视频素材制作到最终剪辑成片的完整链路问题适合具备基础剪辑能力、希望将AI工具引入音乐视频生产流程的读者参考。共1个PDF文件压缩包约3.98MB内容包含操作思路、提示词示例及工具选用经验已有1530人学习下载。阅读后可掌握关键环节借助DeepSeek与豆包反复优化提示词获得与歌词情感匹配的画面描述利用即梦快速生成图片与视频片段并做超清处理再通过剪映完成转场、音乐与歌词字幕编排。文档强调不同AI工具相互配合、取长补短的价值对系统上手AI视频创作具有实操参考意义。1. AI音乐视频制作DeepSeek、豆包、即梦、剪映四件套从歌词到成片全流程不用学达芬奇不用碰专业合成软件一台普通电脑加四款AI工具就能做出一条画面统一、有情绪递进的MV。这条《只字不提》的制作链路是这么拆的DeepSeek和豆包负责把歌词拆成带画面、动态、情感的镜头描述即梦负责把描述变成图片和动态视频片段最后剪映做字幕、转场和音乐对齐。整个过程最花时间的不是剪辑而是前半段的提示词打磨——原作者的提示词反复改了大概半天这个比例在AI视频制作里非常真实。适合谁想给喜欢的歌做MV、做个人短片封面、给短视频号批量产出情绪向内容的从业者。如果你已经玩过即梦或剪映这篇可以直接跳到第二章看提示词结构。2. 用 DeepSeek 和豆包拆歌词10 个画面提示词是怎么打磨出来的2.1 为什么需要两个大模型配合一个出结构一个修细节做歌词画面描述词这件事乍一看很简单把歌词丢给AI让它描述画面就行。但实际做过就知道单靠一个模型出来的结果往往有两个问题——要么画面描述太抽象比如时光流逝感AI给一堆白云流水特效跟歌词情绪完全脱节要么描述太具体把人物、场景定死了后续即梦生成图片时完全没有调整空间。原作者的做法是用DeepSeek和豆包两个模型反复过同一批歌词。我实际复现下来这个配合的价值在于分工DeepSeek擅长把长歌词切分成有逻辑递进的段落更适合做第一次的结构拆解豆包在细化描述、补充光线和环境氛围方面更稳适合做第二轮润色。比如同一句浮云一别后流水十年秋DeepSeek先给的是时间流逝、物是人非的方向豆包再往细节上补变成具体的画面元素——腊梅花苞、晨露、微光。提示不要指望一个模型一次出最终结果。常见的做法是先用一个模型出三版不同方向再拿另一个模型做融合和细化最后人工选一版。这个环节省下来的时间会在即梦抽卡时加倍还回去。2.2 提示词模板把歌词翻译成画面动态情感三段式打磨提示词的基础模板我复现时一直在用的是下面这个结构原作者给出的10个画面描述词基本都符合这个骨架段落作用示例对应画面1画面定场景、主体、色调、光位淡金色破晓背景腊梅细枝挂着深玫红花苞表面带晨露动态写运动方式即梦生成视频时靠这段出效果微光逐渐变强露珠在花苞上微微滚动情感说明这段画面在歌词里承担的情绪对应浮云一别后流水十年秋展现时光流逝中对重逢的期待这个模板的关键在于第三段情感。AI图像生成模型不理解歌词但它能理解期待坚守坚韧这类情绪词并能把这些词转译成光线、色彩和构图倾向。比如画面2写的是暮色渐渐加深影子随之变浓花苞纹丝不动对应歌词君来随君意君走我不留情绪是淡然与坚守——你可以自己对比一下不写情感段直接让即梦生成橙红色暮色里的腊梅大概率得到一张普通的花卉图而不是有故事感的空镜。写提示词经常翻车的人问题大多出在只写了画面和主体漏了光位和影调。素材的一致性靠的就是这些细节10个画面全都围绕腊梅这一个主视觉但分别对应破晓、暮色、晨雾、冷雨、暖阳、午后、浅粉、暴雪、月夜、灰调十种光环境色彩上有呼应又有变化。这正是整支MV画面不散的关键。2.3 从腊梅意象到情绪递进10个镜头的完整拆解原作者选的《只字不提》这首歌歌词里有浮云一别后流水十年秋风吹山丘年华江流山河无言如我只字不提红颜辞镜青春风干好下酒这些句。把这句串起来看情绪是从期待、坚守、蓄势、坚韧走到希望、悠然、情谊、重生最后落到思念和感悟——一个完整的叙事弧线。10个画面全部用腊梅一个主体来承载这条情绪线这是这条MV最值得直接抄的设计画面光环境主体状态对应歌词情绪功能1淡金破晓花苞带露浮云一别后流水十年秋期待2橙红暮色花苞紧闭君来随君意君走我不留坚守3乳白晨雾花苞朦胧此生无多余岁寒两三友蓄势4青灰冷雨花苞摇曳但紧附枝干风吹山丘年华江流坚韧5明黄暖阳花瓣微张山河无言如我只字不提希望6淡蓝午后花朵盛开闲来念旧事与谁饮新酒悠然7浅粉柔光两朵并蒂岁寒两三友情谊8洁白暴雪花瓣从雪中探出风吹山丘年华江流重生9深蓝月夜香丝飘散只字不提的想念思念10浅灰背景花瓣飘落红颜辞镜青春风干好下酒感悟这套设计的精妙之处在于花苞→微张→盛开→飘落刚好对应一段感情的萌生、发展和释然。不需要人物出镜不需要剧情画面自己就有故事线。我复现时把画面7并蒂绽放的位置往前提了一格因为两朵花互动感强放在中间偏前的位置能打破前后都是单花的单调。材料要补成能给即梦直接用的完整提示词可以按这个格式组织主题腊梅深玫红花苞表面带晨露 环境淡金色破晓天空柔和逆光 动态微光逐渐变强露珠在花苞上滚动 氛围期待感时光流逝中的重逢期盼 构图16:9花枝斜向延伸留白区域在右上 风格写实摄影风格浅景深电影感色调参数说明主体、环境、动态负责约束即梦的画面生成构图和风格是我后补的固定项所有画面统一用写实摄影浅景深电影感色调这样10段视频拼在一起不会出现风格跳变。留白位置统一放右上是为了给剪映的字幕留固定空间避免歌词文字压住主体。3. 即梦出图出视频模型选择、参数设置与水印处理3.1 图片 2.0 Pro16:9 比例与超清处理即梦出图这一步原作者明确用的是图片 2.0 Pro模型比例16:9生成后做超清处理。2.0 Pro相比默认模型最大的差别是光影一致性和细节还原度——简单说同一个提示词喂给2.0 Pro花苞纹理、露珠高光这些微距细节会更接近真实摄影而不是插画感。做MV最怕素材像AI生成的艺术字配图2.0 Pro在这点上会好很多。比例选16:9不用解释剪映的默认时间线就是16:9。但这里有个细节很多人忽略即梦生成图片时AI有时会在构图里自带出血位——也就是主体偏小、四周留白偏多人眼看起来是完整的但裁成视频时主体会显得太空。我的习惯是生成时直接要求主体占比更大占据画面中心偏左三分之一宁可构图满一点因为后续图生视频会有动态裁切空间。超清处理这一步建议所有打算用即梦生成视频的图片都做一遍。图片不清晰后面图生视频时会放大缺陷雨丝变成噪点、露珠糊成一团。超清处理本质上是一次AI放大会补细节代价是处理时间变长。如果画面是深色背景画面2暮色、画面9月夜超清效果提升尤其明显——深色区域最容易出压缩噪点。3.2 图生视频抽卡策略与动态幅度控制图片生成后进入即梦的图生视频环节。这一段的核心操作就四个字不断抽卡。原作者也写了不断抽卡以达到比较满意的效果这是整个流程里最耗耐心但也最值得花时间的环节。原因在于目前的AI图生视频对动态的响应是概率性的。同一个提示词露珠在花苞上滚动连续生成三次可能一次是露珠真的在滚动两次是只有光线在变化、露珠纹丝不动偶尔还会出现花瓣消失这种离谱情况。所以实际操作上我一般每个画面至少生成3-4条从中选动态最自然的一条。这个环节没有技巧就是多试。动态幅度参数是这里最容易翻车的点幅度调太强会出现物体形变腊梅枝干扭曲、花瓣变成碎片幅度调太弱视频看起来就只是一张会轻微抖动的图片。不同画面的最优动态幅度完全不一样——画面4雨滴打在枝头、花苞剧烈摇晃幅度要给高画面10花瓣慢镜头飘落幅度要低而且需要在提示词里强调慢镜头。建议从默认幅度开始每次只改一个参数。视频时长方面即梦单次生成的默认时长不长基本够一句歌词的进度。如果需要更长的镜头不要在即梦里硬拉时长——那样动态会失真正确做法是在剪映里做变速后面第四章会细说。素材分辨率出图时已在超清处理时确认视频生成后记得预览检查一下有没有闪烁和变形。3.3 即梦会员值得开吗速度、水印与积分的权衡原作者在素材不够时开通了一个月即梦会员这是个值得单独算一笔账的决定。白嫖用户用免费积分也能生成图片和视频但两个限制绕不过去一是速度高峰时段生成任务排队时间可以长到影响当天工作流二是水印免费生成的视频带即梦水印画面上叠加的Logo后期要处理遮挡会破坏构图裁剪会损失画幅在创作者手里很尴尬。会员的性价比取决于一个指标你要抽多少卡。做一支MV10个画面每个抽3-4条视频至少30-40次生成加上备选免费积分大概率不够用。另外会员用户出错时的后悔药就是重抽成本低确认想继续做视频这个投入基本省不掉。提示会员建议按周期选不要一上来开包年的——先跑完一个项目试试自己能不能坚持这个流程值回票价再续。我见过不少人开了年费会员只用了不到一周的热度。4. 剪映做最后一公里转场、字幕与音画对齐4.1 导入与粗剪按情绪线排镜头顺序视频片段生成完毕后面就全部在剪映PC专业版完成。先把所有视频片段导入剪映按第二章的10个画面顺序拖到时间线上。不要细剪先粗排一遍看情绪线是不是顺画面1淡金期待→画面2暮色坚守→画面3晨雾蓄势→画面4冷雨坚韧这个前半段是向外求后半段画面7并蒂绽放、画面9月夜思念是向内收。粗剪阶段只做三件事裁掉每段视频首尾不稳定帧AI视频生成的头尾通常有3-5帧画面抖动或变形、确认每段长度对齐对应的歌词段落时长、删掉动态奇怪的片段换备选。判断动态是否达标的唯一标准就是循环播放配合歌词听——画面对上副歌重音时情绪不别扭就留着。会失败的常见做法是先把所有片段都细剪完再拼结果发现中间衔接有内容缺失返回去找素材。正序应该是粗排找缺失、补素材或重生成确认完整后再细剪。4.2 歌词字幕两条路效果差很多字幕是这支MV的观感主力操作上有两条路第一条路是剪映的识别歌词功能。剪映对纯音乐做音频识别容易错字但人声歌曲的识别率非常高——直接把《只字不提》的音频导入用自动识别就能按时间轴生成一句句歌词字幕。识别完成后需要人工对一遍AI的同音字错误基本集中在第一句和最后一句因为人声起唱和收尾时最容易被环境噪声干扰。第二条路是手动卡点。把歌词按句分割逐句对齐到时间线上。好处是准确坏处是慢——整首歌20多句歌词一句句拖要对半天。我复现时的做法是混合先用自动识别出底稿再手动修正个别错字和对不齐的时间点这样效率最高。剪映的语音转写优先级会选到分离人声模式不加背景音乐时识别更稳。字幕样式上10个画面有9个是深色背景白字加细描边基本能用但画面1淡金色背景、画面6淡蓝色背景下白字会看不清。推荐做法是给字幕加半透明黑底或统一用浅白灰色描边保证所有画面下都有对比度。字号别超过画面宽度的三分之一一句长歌词需要拆成两行时保持两行左右对齐。字幕具体用单句还是双行建议先出一版10秒样片在4K预览下确认不穿帮再继续。4.3 转场和卡点让画面踩在歌词上转场的选择遵循一个原则情绪平的地方用淡化情绪重的地方用叠化或闪白不用花哨的3D转场。AI生成的视频片段本身缺少运镜花哨转场反而会暴露镜头衔接的生硬。一个比较稳的组合方案是画面之间全部用0.5秒交叉淡化短歌词句之间的节奏快画面切换跟重音走副歌高潮段前后用到叠化轻微放大模拟推进感。具体参数上交叉淡化时长0.3-0.5秒叠化重叠区间0.4秒放大比例105%左右超过110%画质会变肉。卡点让画面踩在歌词上这里我一般会重点处理傅出词第一个字落下的瞬间画面必须切完。浮云一别后这句前奏的长音过后浮字出来画面同时从花开切到水面这个同步做好了整段MV都顺。剪映PC专业版时间线可以直接放大到帧级卡点用放大时间线手动对最准确。5. AI 做 MV 常见问题排查六个翻车点与对应解法5.1 画面风格不统一每张图各玩各的现象10个画面拼在一起有的像照片、有的像插画、有的像动画整支MV像硬拼出来的PPT。 原因提示词里没有统一风格锚点。只描述了内容花、天气没有描述画质归属。 解决在每条提示词固定位置加同一句风格约束例如统一加写实摄影风格浅景深电影感色调85mm镜头视角。即梦出图模型对风格词的响应优先级非常高固定这行描述能让所有画面落在同一个视觉体系里。我复现画面7、8时发现只要漏了风格行输出的就是另一种质感。5.2 视频素材数量不够歌词比画面多现象歌词有20多句画面只有10段剪到后面没素材可用了。 原因分镜阶段规划不足。作者原话也承认歌词太长现有视频画面素材根本不够用最后靠开通即梦会员补生成素材。 解决分镜时先把歌词按段落数一遍再决定画面拆分数量并额外预留2-3段备选空镜——树枝、花瓣飘落、风吹花枝这类与主线无关的过渡素材。备选素材在剪辑时不仅能补时长还能做转场挡板遮住跳点。5.3 即梦视频动态幅度太小出来是一张会呼吸的图现象图生视频生成后画面只有轻微的光影变化花朵、枝条完全静止。 原因提示词里的动态描述太弱或者动态幅度参数设得偏低。AI图生视频对可见运动的生成是有概率的抽卡没抽中画面就会静如一张图。 解决在提示词里强化动态主体。例如画面4改成密集雨滴打在腊梅枝头花苞在风雨中剧烈摇晃但紧紧附在枝干上雨滴滑落速度中等同时把动态强度上调。如果还不动检查是否误开了镜头静止模式——图生视频默认镜头可动开了静止镜头后画面内物体运动也会被抑制。5.4 生成的图片上有乱码文字和图标现象即梦生成的图片局部出现奇怪的文字、字母甚至水印残留。 原因模型试炼把提示词中的某个词映射成了文字纹理或者是参考图自带了不可见水印。 解决生成时避免在提示词里出现文字描述比如不要在提示词里写写有字的木牌字幕位置留白。如果乱码已经生成优先用即梦的局部重绘修正而不是在剪映里硬盖画面重绘遮住乱码区域再采样一次可以保留其余部分不动。夜间深色背景更容易出文字噪点检查时放大到200%看。5.5 剪映字幕和音频相差半拍现象画面和字幕对上但歌词先出来或后出来歌词和声音对不上。 原因自动识别的断句位置是按声音能量来划分的气口和换气声会让识别结果提前或延后。 解决识别完成后逐句听一遍专门找句首浮山红这类爆破音开头的歌词调整到波形起点对齐。另外画面上有字幕时人脸周围的画面元素会被画面遮挡一部分注意不要在构图中心区放字。歌词错位超过0.3秒就能明显感知建议按帧微调。5.6 生成成本失控积分像水一样流走现象画面不满意反复生成一天下来积分或会员次数耗尽。 原因抽卡没有节制也没有给每次生成设定可接受的达标标准。去水印之后不用再担心水印问题但耗时仍耗钱。 解决设定每个画面最多抽4次的硬上限抽不中就从提示词里改一个变量再抽比如只改光环境或动态幅度而不是整条提示词推倒重来——保持变量单一既是控制成本也更自律。还有个小习惯固定用一组历史抽卡效果最好的提示词骨架新增画面只替换主体和环境变量能大幅降低翻车率。6. 成片验证导出前检查清单与两种进阶玩法方向6.1 导出前的五项检查AI视频素材在剪映时间线上看着正常导出后却容易出现画质劣化、偏色和声音延迟这是每个新手都会遇到的一道坎。我现在每次导出前都强制自己走一遍这四项一全片从头到尾预览一遍专看转场前后一帧的画面对齐——AI视频片段切换时偶尔会闪黑或者跳白这类问题在电脑上预览时容易被忽略但手机端播放会非常明显二检查字幕和音频对拍逐帧确认重点盯第一句和最后一句歌词三关闭所有片段的分辨率缩放确保没有素材因手动缩放被强制拉伸四如果片子超过1分钟分段导出再拼接导出时优先用与原素材相同的帧率。6.2 进阶玩法把这条流水线复用到其他项目这套流程的颗粒度拆解以后完全可以横向迁移换一首歌拆出歌词段落用同样的提示词模板换掉主体和环境变量想换风格只改第二章提示词里的风格锚点那一行。我上次把主体换成雪松、结构换成初雪、深雾、晴空、融冰一天就出了新片各工具的分工没有变。原作中最贵的不是哪一款AI工具而是对画面的整体把控力和舍得删片的判断力。从那以后我每次在即梦点生成之前都会在文档里把三条固定项过一遍有没有统一风格锚点、动态描述里有没有能动的对象、画面留白位置是否清空给了字幕。这个习惯让抽卡成本至少降了一半希望帮到你。本文还有配套的精品资源点击获取