
做AI视频这半年我最大的感受是大部分人的提示语根本不配称之为提示语。就拿最常见的例子来说很多人写的是“一条狗在草地上跑”模型确实给你一条狗在草地上跑但镜头一动不动、光线平平淡淡、质感糊成一团看完跟没看一样。而我拆了463条高赞AI视频之后发现真正能让人“哇”出声的视频提示语普遍在80词以上里面塞满了镜头语言、光影逻辑、材质细节和节奏控制。于是我把这463条视频全部分析了一遍把它们的画面拆成可复用的提示语模版又封装成了AI编程工具可以直接调用的Skill整套东西已经开源。这篇文章我把完整的方法论、拆解流程、Skill配置和踩坑过程全部写出来不管是刚入门AI视频的新手还是已经在用Claude Code、Curson等工具的开发者都能直接拿去用。1. 项目思路与整体设计1.1 为什么要拆463个视频先说这个数字怎么来的。我花了两周时间把国内外主流AI视频平台的高赞作品翻了个遍包括可灵、即梦、Runway、Pika、Luma以及Sora官方展示页。筛选标准很简单播放量超过50万或者点赞过万同时评论里没有人吐槽“画面很假”“动作僵硬”。符合这两个硬指标的视频我才把它收进样本池。最后凑齐了463条覆盖人物、动物、城市、自然、产品、科幻、古风、美食等十多个题材。拆完这463条视频后我得出了一个非常扎心的结论优秀视频和普通视频的差距80%不在模型而在提示语的结构化程度。普通用户写提示语大多是一句话描述主体比如“一个女孩走在街上”。而高赞视频背后的提示语通常是“电影感镜头28mm广角女孩穿着红色风衣走在雨后湿漉漉的街道上地面有霓虹灯倒影镜头缓慢跟随浅景深背景虚化颗粒感胶片质感”。这不是玄学是实打实的可复用规律。所以我做这个项目的核心思路就一句话把视频“翻译”回提示语把隐性经验变成显性模板。视频是模型的输出提示语是模型的输入通过逆向拆解我们能反推出什么样的输入会得到什么样的画面。这个过程和做菜时看成品猜配方很像——看到一道红烧肉色泽红亮、肥而不腻你就得反推用了多少糖、多少酱油、火候怎么控制。拆视频就是拆配方。1.2 为什么做成Skill而不是普通文档最开始我只是把模板整理成了一份几千行的Markdown文档放在本地自己查。但用了两天就发现效率太低每次写新提示语要在一堆模板里人工翻找、拼装、调整比自己从头写也没快多少。这时候我想到Skill——那是Claude Code生态里的一种技能封装方式本质上是把“说明书可执行逻辑”放在一个目录里让AI助手在需要时自动加载并按照标准流程干活。把提示语模版做成Skill之后使用方式完全变了不需要人肉查文档只要告诉AI“我要做一条赛博朋克城市夜景的短视频”Skill就会自动读取模板库匹配对应的风格标签、镜头标签和光影标签然后生成三条不同运镜的候选提示语供你选。对用户来说交互从“翻文档”变成了“提需求”对AI来说输入从“一段模糊要求”变成了“一套结构化执行路径”。这也是我最终决定开源的原因。文档型开源项目很多人会收藏但不会用因为缺少落地入口Skill型开源项目则可以直接被工具加载用完马上出结果。我见过太多人收藏了上百个提示词库真正用起来的没几个。做成Skill就是逼着自己把“收藏夹里的资料”变成“生产力工具”。2. 核心细节解析视频拆解维度与提示语结构2.1 拆解视频的六个核心维度把463条视频拆完我沉淀出了一套稳定的拆解框架一共六个维度。这六个维度基本覆盖了AI视频提示语的全部变量不管什么题材的视频都能用它们做结构化拆解。第一是主体与动作。主体是谁、在做什么、动作幅度大不大、有没有物理交互比如风吹头发、手触碰水面。这是提示语里最基础的部分也是大多数人只会写到的部分。第二是镜头语言。包含景别特写、中景、全景、大远景和运镜方式推、拉、摇、移、跟随、环绕、俯拍、仰拍、手持晃动。这一维度是AI视频和AI生图最大的区别因为视频是时间的艺术镜头一动整个画面的叙事感就出来了。第三是光影与色调。比如晨光、黄昏、霓虹、烛光、阴天漫射光、逆光剪影以及整体色调偏冷还是偏暖、饱和度高低。第四是氛围与风格。电影感、纪实感、梦幻感、赛博朋克、国风水墨、微缩模型、黏土动画等等。第五是节奏与运动速度。画面里物体运动快慢、镜头运动快慢、是否有慢动作或延时效果。第六是画面质感与负向约束。胶片颗粒、浅景深、HDR、8K清晰度以及“不要变形的手”“不要多余的人”“不要闪烁的光”这类否定约束。拆解顺序也是有讲究的。我建议先定镜头语言再定主体动作然后补光影和风格最后加质感和负向约束。为什么这个顺序因为AI视频模型的生成逻辑是“先构图、后填充、再渲染”。镜头语言直接决定构图框架主体动作是填充内容光影和风格是渲染氛围质感是最终润色。按这个顺序写提示语模型的理解负担最小成片率和预期最接近。2.2 提示语模版的通用骨架基于这六个维度我把463条视频的提示语逆向整理成了一个通用骨架。所有模板都是在这个骨架上填充不同的值骨架长这样[景别] [镜头运动] [主体描述] [动作细节] [环境场景] [光照条件] [色调风格] [画面质感] [负向约束]举一个实际例子。我拆过一条高赞的可灵视频画面是一只白猫蹲在窗台上窗外下雨猫瞳孔放大盯着雨滴镜头从猫侧面慢慢推到眼睛特写色调是灰蓝色有浅景深和雨滴反光。逆向还原成提示语模版就是中景到特写推镜头白色长毛猫蹲在木质窗台上瞳孔放大目光跟随窗外落下的雨滴窗户玻璃上有凝结的水珠背景是模糊的雨中城市灰蓝色调漫射自然光浅景深电影质感细节清晰手指变形和多余人物不要出现这条提示语总共14个信息点而普通用户可能只会写“窗台上有一只白猫看着外面”。同样的主体一个能出片一个出废片差别全在骨架的完整度上。我还统计过一个有意思的数据463条视频中有效提示语里包含10个及以上信息点的占了87%包含5个以下信息点的不到3%。这也是为什么提示语模版这种“标准化拼装”的思路可行——高手的提示语虽然看似各不相同但底层骨架高度一致。2.3 模板分类与标签体系设计模板不能堆在一个文件夹里必须分类。我按照创作场景把所有模板分成了三层题材层、镜头层、风格层。题材层包括人物、动物、城市建筑、自然风光、产品广告、美食、科幻、古风、恐怖悬疑、抽象艺术一共10类。镜头层按照运镜方式分为推、拉、摇、移、跟随、环绕、俯拍、仰拍、手持、固定机位一共10类。风格层则包含电影感、纪录片、动画、水墨、油画、赛博朋克、蒸汽波、微缩模型、黏土、延时摄影也是10类。这样设计的好处在于组合爆炸。一个题材乘一个镜头乘一个风格理论上能组合出1000种不同的提示语风格。实际使用时你只需要告诉Skill三个标签比如“产品 环绕 电影感”Skill就会自动从模板库里匹配对应模板生成了一段“产品居中背景深黑镜头缓慢环绕侧逆光勾勒轮廓桌面有镜面反射电影感浅景深胶片颗粒质感”的提示语。这种标签化设计让模板库不只是一个静态文档而是一套可以自由组合的可编程素材。3. 从视频到Skill的实操流程3.1 视频样本的收集、筛选与拆帧如果你想复刻这个项目第一步不是写Skill而是积累样本。我用的方式是这样的先用脚本去各大AI视频平台的热门榜抓取视频链接和基础数据播放量、点赞量、描述文案然后人工过一遍剔除那些靠标题党吸引流量但画面质量一般的视频再把符合条件的视频下载到本地。接下来是拆帧。我用ffmpeg把每个视频按每2秒一帧的频率抽成序列帧画面变化剧烈的视频会加密到每0.5秒一帧。为什么要拆帧因为视频是连续画面人的眼睛很容易被动态蒙骗光靠肉眼反复播放很难看清光影方向、镜头运动轨迹、景深变化这些细节。拆成单帧后就能像看摄影作品一样逐个分析而且可以在关键帧上做笔记。拆帧之后我会给每个视频打标签并写一段“视觉描述草稿”。这个过程看起来很笨但非常有效——它逼着你把看到的画面转成文字而 AI视频提示语本质上就是“图片转文字”的能力。我一般每个视频记录三样东西画面结构主体在哪里、前后景关系、镜头特征景别、运镜、速度、质感特征光线、颗粒、色调。这三样就是后续模板的核心素材。3.2 逆向Prompt从画面到文字的翻译过程把画面转成提示语看起来是写句子其实是翻译。你需要把视觉信息逐项转成模型能理解的语言表达。我总结了一个三步走的翻译方法。第一步描述主体和动作。只把画面里最核心的东西写下来不掺杂任何修饰比如“穿红裙的女性站在沙漠中风吹动裙摆”。这一步的目的是锚定主体避免模型自由发挥。第二步叠加拍摄信息。根据画面特征判断镜头语言这个画面是特写还是全景镜头是静止的还是在移动人在画面中的大小占比如何把这些写成“特写镜头从面部缓慢拉远到全景人物位于画面右侧三分之一处”。第三步叠加氛围和质感。用形容词和名词堆砌出画面质感比如“黄昏金色侧光”、“冷暖对比强烈”、“沙粒质感清晰”、“胶片颗粒感”。到这一步一句合格的逆向提示语就出来了。这里有个关键诀窍多用名词和具体词组少用抽象形容词。比如“高端的”这个词模型很难理解但“金属拉丝质感、表面有反射光、边缘倒角处理”模型就能精确执行。AI视频模型本质上是词元预测器它擅长的是把视觉词汇拼成画面而不是理解形容词的抽象含义。这一点和写给人类看的文案有本质区别。3.3 Skill目录结构与配置文件编写素材整理到一定程度就可以开始封装Skill了。我选择的目录结构是这样的ai-video-prompt-skill/ ├── SKILL.md ├── assets/ │ └── templates.json └── scripts/ └── export.pySKILL.md是整个Skill的入口文件采用frontmatter加正文的格式。frontmatter里必须写清楚name、description、id三个字段。id字段就是所谓的“skill编码”我给每个Skill都编了唯一ID比如ai-video-prompt-skill的id是247这样在多Skill协作时不会互相冲突。description字段特别重要AI助手靠它来判断什么时候加载这个Skill所以不能写得太空泛要写明它能处理哪些类型的视频提示语生成任务。SKILL.md正文部分我做了三件事。第一是写清楚使用流程用户给主题后先识别题材、镜头、风格三个标签再从templates.json中匹配模板然后填充具体内容最后给出一到三条完整提示语。这一步相当于给AI设定标准作业程序避免它自由发挥。第二是写清楚输出格式每条生成的提示语必须标注所属模板编号、适用平台、镜头类型、预估时长方便用户追踪效果。第三是写清楚注意事项比如中文提示语和英文提示语的差异、不同平台对提示词长度的限制、负向约束应该放在提示词末尾等。3.4 模板库JSON格式与调用解析模板库我存在assets/templates.json里结构是嵌套JSON按题材-镜头-风格三层索引。每个最终模板是一个对象包含id、name、tags、prompt、negative、platforms六个字段。{ id: human-follow-cinematic-001, name: 人物跟随电影感, tags: [人物, 跟随, 电影感], prompt: 中景跟随镜头[主体描述]行走在[环境描述]中镜头保持与人物同步移动[服装细节][光影条件][色调风格]背景虚化电影质感胶片颗粒自然运动模糊, negative: 画面抖动、人物变形、多余物体、曝光过曝, platforms: [可灵, Runway, Pika] }调用方式很简单Skill读取templates.json后用用户给的标签做匹配。比如用户说“我要一条产品环绕镜头赛博朋克风格的视频”Skill就筛选出tags同时包含“产品”“环绕”“赛博朋克”的模板。匹配到模板后再把方括号里的占位符按用户输入转换成具体内容比如把“[主体描述]”换成“机械键盘”“[环境描述]”换成“黑色桌面配合霓虹光管反射”最终生成一条完整可用的提示语。占位符设计是整个模板库的灵魂。我花了几天时间统一了占位符体系从[主体描述]、[环境描述]、[服装细节]、[光影条件]到[色调风格]、[主题道具]、[背景元素]一共17个标准占位符。统一命名的好处是模板可组合性更强任何一篇模板都能和其他模板拼装而且AI在填充占位符时不会混淆语义。4. 开源项目结构与使用方法4.1 模板库的目录组织与覆盖范围开源仓库除了Skill本体还带一个完整的提示语模版库就是项目名里说的“提示语模版”。模板库按三级目录组织。第一级按题材分1-person人物、2-animal动物、3-city城市、4-nature自然、5-product产品、6-food美食、7-scifi科幻、8-classical古风、9-horror恐怖、10-abstract抽象。第二级按镜头语言分01-push、02-pull、03-pan、04-tilt、05-tracking、06-orbit、07-top-view、08-low-angle、09-handheld、10-static。第三级就是具体的模板文件。每个模板文件包含三个部分适用场景说明、正向提示语、负向提示语。适用场景说明包括这个模板适合的题材类型、情绪基调和平台类型。正向提示语就是完整可用的提示词你直接复制到AI视频平台就能用。负向提示语建议放在参数设置的排除项里。覆盖范围上我这463条视频共产出了287个基础模板再经过标签组合扩展实际可调用组合数超过1400种。我不敢说覆盖了AI视频的所有风格但市面上比较主流的表现手法基本都收录了。特别说明一下有31条视频因为画面构图过于相似、辨识度低我没有为它们建模板而是直接合并到了相近模板里。质量比数量重要模板库里如果塞太多同质化内容反而会降低匹配精度。4.2 在Claude Code、Curson等工具中安装Skill安装过程很简单但我会把步骤写全因为这里有几个很容易出问题的地方。如果你用的是Claude Code先把仓库克隆到本地git clone https://github.com/yourname/ai-video-prompt-skill.git然后进入目录把Skill安装到Claude Code对应的skills目录cd ai-video-prompt-skill mkdir -p ~/.claude/skills cp -r skill/ai-video-prompt-skill ~/.claude/skills/重启Claude Code后输入“使用AI视频提示语Skill帮我生成一条赛博朋克城市夜景视频的提示语”如果Skill正确加载回复里会包含“已加载模板编号xxx”之类的内容说明配置成功。如果你用的是Curson则可以直接在项目根目录的.cursor/rules/路径下把Skill目录放进去Curson会自动识别SKILL.md里的描述字段在相关对话中拉起技能。如果你用的是其他Agent工具需要确认它是否支持SKILL.md规范。目前市面上主流支持Agent Skill的工具大多兼容这套格式如果不支持也可以退而求其次直接把templates.json和模板文件作为参考资料喂给AI让它根据模板格式生成提示语。只不过体验上会打折因为少了一步“自动识别并加载”的流程。4.3 三类典型调用示例与输出效果我给出三个实际调用过的典型示例你可以直接照着试。第一个示例是“人物推镜头电影感”输入描述是“一个穿风衣的男人站在雨里回头看向镜头”。Skill输出结果大概是这样“全景到特写缓慢推镜头穿黑色风衣的男人站在倾盆大雨中雨水顺衣角滴落男人缓慢回头直视镜头表情冷峻湿发贴合额头背景虚化的城市灯光冷蓝色调胶片颗粒质感浅景深微慢动作效果”。这条提示语比原始描述多了近60个字的有效信息在可灵上实测稳定出片画面氛围感很足。第二个示例是“产品环绕超写实”输入描述是“展示一款智能手表”。Skill输出时自动填充了商业广告的术语“手表悬浮在深色大理石桌面上方表盘表面有细微光线扫过金属表带反光自然镜头以产品为中心做45度环绕运动背景渐变黑侧逆光勾勒轮廓玻璃镜面有轻微反射广告级渲染细节逼近实拍”。这类产品视频用固定机位很容易显得呆板环绕镜头能明显提升动态感这个模板就是从Runway上一组爆款产品视频里拆出来的。第三个示例是“动物跟随自然纪录片”输入描述是“一只猎豹在草原上奔跑”。Skill输出时自动加上了纪录片的节奏控制“低角度跟随镜头猎豹在金黄色草原上高速奔跑肌肉线条随步伐起伏清晰可见背景快速运动模糊尘土飞扬阳光从侧面穿透尘埃形成光柱效果自然色彩还原真实毛发细节画面稳定暂停帧清晰”。4.4 开源协议与二次开发建议整个项目我用MIT协议开源商用和个人使用都随意但希望大家能在衍生项目里保留原作者署名。仓库里同时放了一个docs/目录里面有463个视频的标签统计Excel、拆解笔记示例、以及我筛选视频时用的评分表模板。你拿到的不仅是一堆成品模板还可以顺着这个方法论建立自己的视频样本池和模板库。二次开发方面我留了几个扩展点。第一templates.json里的platforms字段预留了多平台支持你可以在自己的分支里为不同平台编写专属模板。第二scripts/export.py支持把JSON转成CSV和纯文本两种格式方便接入其他工具。第三我在Skill里留了一个“模板自检”命令输入“自检”它会遍历模板库找出缺失占位符或者标签冲突的异常条目方便持续维护。5. 常见问题与排查技巧实录5.1 Skill加载失败或提示语匹配不准Skill加载失败十有八九是description字段写得不够清楚。AI助手加载Skill靠的是语义匹配如果你的描述写成“视频提示语工具”它可能很多场景都想不起调用。我建议把description写成这样description: 生成AI视频提示语的技能支持人物、产品、城市、自然等题材可指定推拉摇移等镜头语言自动匹配模板并输出中英文双语提示词适用于可灵、Runway、Pika、Luma等AI视频生成平台。匹配不准的问题根源往往在标签粒度。我刚开始把风格标签只分成“电影感”“纪实感”两个结果用户说“我要复古感觉”时模型匹配不到。后来我把风格层扩到25个细分类并且给每个模板加了同义词标签比如“复古”同义关联“80年代、胶片、旧时光、VHS”。同义词标签是模板匹配的润滑剂AI视频创作者的表达习惯千差万别只有标签足够泛化才能覆盖住。5.2 生成视频镜头过快或过慢的处理用模板生成的视频最常遇到的画面问题是运动速度不对。很多平台生成的视频镜头推得太快显得急促或者镜头纹丝不动显得呆板。解决这个问题有两条路径。第一条路径是加速度描述词。你可以在提示语的镜头部分插入“缓慢”“非常缓慢”“匀速”“逐渐加速”这类词。注意要放在镜头运动描述后面比如“镜头缓慢从全景推到特写”而不是放在整个提示语末尾。放在末尾容易被模型忽略因为AI视频模型对提示词不同位置的关注度是不同的越靠前的视觉词权重越高。第二条路径是调整平台的动态参数。可灵、Runway、Pika都有类似“运动幅度”“镜头速度”的滑块把模板生成的提示语里镜头描述直接对应到滑块上。通常“跟随镜头”对应中等运动幅度“环绕镜头”对应偏大幅度“固定机位”对应最小运动幅度。我的模板里已经在prompt字段后标注了推荐的动态参数范围你照抄即可。5.3 中文提示语和英文提示语的兼容性我实测下来不同平台的提示语语言偏好差异很大。可灵和即梦对中文提示语的理解很稳定但Runway和Pika对英文提示语的执行效果远好于中文Sora则对英文句法结构非常敏感。所以我给每个模板都配了中英双语prompt字段。实际使用时有几个小技巧可以分享中文提示语适合用逗号分隔短语每个短语一个视觉元素信息点清晰分明英文提示语适合用动名词开头加介词短语比如“Close-up shot, slowly pushing in, a woman in a red coat walking through a rainy street, neon reflections on wet asphalt”。英文提示语不要写的像作文一样有完整主谓宾句法结构词块堆砌远优于完整句式因为模型对连续实义词的理解更直接。5.4 模板库维护和开源协作的注意事项开源项目最怕的是一发布就没人维护模板库过三个月就过时了。AI视频模型迭代非常快新模型往往支持更长提示语和更复杂的指令老模板不一定能用上。我自己定的维护节奏是每两周补充一次新模板从最新热门视频里拆解提炼同时清理掉那些在平台上已经无法稳定出片的旧模板。协作方面我建议贡献者遵循三条规则第一新增模板必须附带来源视频的ID或截图方便审核时对照画面第二所有模板必须使用标准占位符体系不允许自创占位符第三每个模板必须同时提供中英文版本。这三条规则虽然会增加一些工作量但能保证模板库长期保持可用状态而不是变成一堆没人认领的碎片。我在仓库里放了CONTRIBUTING.md详细说明这些规则看到有人已经在按这个流程提PR了这种大家一起养一个开源项目的感觉比一个人闷头拆视频有意思得多。6. 实操心得与后续扩展思路最后再分享一点我个人的体会。把463个视频拆完、模板写完、Skill封装好之后我最强烈的感受是AI视频创作正在从一个“靠灵感”的领域变成“靠体系”的领域。普通用户和高手之间的差距不再是谁更有想象力而是谁更懂得把想象转化成模型听得懂的结构化语言。提示语模版把这件事变成了可学习的技能而Skill把这种技能变成了可调用的工具。我给到你的建议是拿到开源仓库后先不要急着直接调Skill批量生成。花一个下午时间从模板库里挑出10个模板手动复制到你的AI视频平台里跑一遍对比每次加一个信息点之后画面发生什么变化。等你亲手跑完这10组对比实验你就彻底理解了提示语里每个短语在画面上到底起什么作用以后不用模板也能自己写出一手好提示语。这不是绕路这是最扎实的上手方式。后续我自己还会继续维护这个项目目前已经规划了几条扩展方向一是把模板库扩充到1000条以上覆盖更多冷门风格二是把Skill升级成支持多轮对话——用户先描述一个想法Skill自动追问“画面主体是什么”“想要什么镜头语言”“哪个平台使用”连续收集信息后再一次生成高质量提示语三是做一个简单的web版模板检索页方便不开IDE的人也能快速搜索模板。这些功能如果实现顺利我都会继续开源出来感兴趣的话可以关注这个仓库或者直接提Issue一起讨论。