ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI视频剪辑实操教程:看懂语义的剪口播Agent,从装环境到出成片一次跑通

AI视频剪辑实操教程:看懂语义的剪口播Agent,从装环境到出成片一次跑通

AI视频剪辑实操教程:看懂语义的剪口播Agent,从装环境到出成片一次跑通

【免费下载链接】chengfeng-videocut-skills用 Claude Code Skills 做的视频剪辑 Agent项目地址: https://gitcode.com/gh_mirrors/vi/chengfeng-videocut-skills

你有没有过这样的经历:录了二十分钟的口播,剪的时候光是为了删掉"嗯""啊""那个"和说错重录的句子,就耗掉一整晚。用剪映的智能剪口播,它只认字不认意思——同一个词换个说法它就漏掉;自动识别的字幕里,专业名词错得一塌糊涂,还得手动一条条改。如果你正在被这类问题折磨,这篇文章介绍的项目正好对症。

chengfeng-videocut-skills是一个基于 Claude Code Skills 构建的 AI 视频剪辑 Agent。它不靠"模式匹配"剪片,而是真正理解视频里说了什么:能认出哪些是重复句、哪些是说到一半改口的残句、哪些是口误后重说的正确版本;字幕也能用自定义词典把技术名词改准。本文用一条完整的使用路径,带你从装环境走到导出成片。

开工之前,先搞清楚这个项目长什么样

项目把剪辑拆成四个互相独立的技能(Skill),各自只干一件事,像流水线上的四个工位:

技能负责的事产出物
剪口播找出口误、重复、残句,出删词清单人工复核过的删词账本(不切媒体)
字幕用词典和文稿改准专名,按句分屏subtitles.json
画面在画面上盖标注、动画、推近效果visuals.json + HTML 模块
导出把剪辑、字幕、画面一次烧进视频成片.mp4

这种拆分的好处是:每一步的产物都是可检查的中间文件,而不是一上来就"咔"一刀剪下去。剪口播这一步尤其反直觉——它从头到尾不碰视频文件,只产出一份"删词账本",等你审完、确认了,才轮到导出去真正执行剪切。

第一步:把环境装起来(约10分钟)

项目目前支持macOS 和 Windows 10/11。先拉取仓库到本地:

git clone https://gitcode.com/gh_mirrors/vi/chengfeng-videocut-skills

机器上需要预先装好四样东西,缺任何一个,首次运行都会在对应环节明确停下,不会静默跳过:

依赖用途版本要求
Bun运行剪辑产品本体≥ 1.2
Node.js跑就绪检查脚本近代版本即可
ffmpeg剪辑与导出≥ 6(含 ffprobe)
Google Chrome渲染字幕和动画桌面版

macOS 用 Homebrew 一把装齐,Windows 用 winget:

# macOS brew install oven-sh/bun/bun node ffmpeg # Windows(装完新开一个终端,PATH 才生效) winget install Oven-sh.Bun OpenJS.NodeJS.LTS Gyan.FFmpeg Google.Chrome

云端转录还需要火山引擎的 API Key,配置方式:

node scripts/videocut-cli.cjs config set transcription.apiKey <你的key>

装好依赖后,对 Agent 说一句"安装剪辑环境",它会自动完成就绪检查:确认 skills 是否最新、Runtime 是否配套,缺什么补什么,全程有 SHA-256 校验,不会从漂移的"latest"版本乱装。首次安装需要等几分钟下载运行时,属于正常现象。

第二步:剪口播——先出账本,不动媒体

这是整个项目最核心的能力。对 Agent 说:

使用"剪口播"处理这条视频。识别口误,等我审核后再物理剪切,并生成剪后字幕。

它的内部流程可以概括为七步一线,每一步都有明确产出物,没出表就不算完成:

  1. 建档:接受本地真实视频,云端逐词转录,建项目,启动常驻服务
  2. 修字:用词典把转录听错的字改对,先出"修字表"给你看
  3. 删词:把播放顺序完整读五遍,每遍只盯一类问题
  4. 汇总:把五轮的判断合并成两张表(删词汇总表 + 重复句子表)
  5. 审核:把表呈给你,打开审核页让你亲自复核
  6. 复盘:对比你的修改和 AI 的提案,把口味差异沉淀进偏好文件

其中"五轮扫描"是语义理解的关键,每轮只带一个判据,判断质量远高于一次带六个:

轮次找什么例子
第1轮重复(句间/句内)"这个功能呢"连说两遍
第2轮残句与改口说一半断掉,换个说法重说
第3轮口误重说数字、专名说错后重说对的
第4轮英文卡壳词头、字母、音节重复
第5轮口头禅与语气词按你偏好的密度来删

一个值得记住的原则是**"删前保后"**:后说的内容通常更完整,所以重复和改口默认保留最后版本。相邻两句开头有至少 5 个字相同,自动判定为重复并删前句。长句、整句、分叉重说这类高风险项,一律标记为高优先级让你重点听。

实战案例:一段 19 分钟的口播原素材,系统自动识别出 608 处问题(114 处静音 + 494 处口误/重复),生成可视化审核页面,你确认后执行剪辑,最终成片只有 72MB,附带专业级字幕文件。

第三步:字幕——不重新转录,用词典改字

很多工具的"AI 字幕"就是重新听一遍剪好的视频,既花钱又慢,而且专名照样错。这个项目的字幕思路完全不同:它直接用剪口播时已有的逐词稿 + 删词账本,算出每个词在成片里的时间,不需要再送一遍 ASR。

改字分两级:

  • 词典:这个说话人固定的写法,不看上下文直接改,改完列清单。比如"叉"就是"X","大模型"就是"大模型"
  • 文稿:作者手上有稿子时才用,逐处要证据,对不上的报"不敢定",绝不瞎猜——因为名字写错比听错更糟

改完字就分屏:一个标点一段、一屏一行,和剪口播的分段粒度完全一致。太长的句子均摊拆屏,碎片屏自动合并(但不跨句号并,避免两句糊在一起)。

第四步:画面——给口播配上会动的分镜

这一步给剪好的口播盖视觉层:圈重点标注、整屏动画、推近效果。层是 HTML 模块,绑定在字幕屏上,由播放器逐帧驱动,你在预览里直接能看到效果。项目自带一套"小黑漫画"风格的 SVG 动效模板,把生图拆解成可控的 SVG 层,传送带、纸张、箱子、断点都能单独动,适合演示类口播的步骤可视化。

配画面的判断逻辑很克制,并不是每段都要加东西:

  • 画面正好是正在讲的东西 → 圈住标注,说到哪个词圈哪里
  • 画面空白或弱相关 → 用整屏动画补
  • 画面自己足够清楚 →不动,这是最常见的正确答案

第五步:导出——所有图层一次烧进 mp4

导出是链条最后一段,也是唯一真正画出像素的地方。先跑--dry-run看计划(片长、帧数、字幕屏数、画面层数、输出尺寸),数字不对就是上游有问题,别等编码十分钟后才后悔。确认无误后正式导出,剪辑、推近、字幕、动画层一次全部烧进视频。

这里有个容易被忽略的常识:源片分辨率是天花板,放大不会变清楚。源宽超过 2560 就直接用原分辨率;如果源片是 960×720 这种低清录屏,优先去录屏工具里找同一次录制的高清导出——换源比任何后期都管用,而且因为音频逐位相同,换源后词稿、账本、字幕、画面层全都不用动。

常见问题与避坑指南

Q1:云端转录超时怎么办?检查上传环节的网络连接是否稳定。转录服务是云端的,网络波动会直接导致超时。

Q2:审核网页打不开?先查端口是否被占用。可以用lsof -i :8899(macOS)检查,找到占用进程处理后重试。

Q3:剪完音画不同步?系统底层用filter_complex + trim技术保证时间轴精确对齐,如果出现不同步,多半是 ffmpeg 版本过低,升级到 6.0 以上。

Q4:Runtime 装不上怎么办?把 Agent 的报错原文整理后走"上报 Bug"技能提交。注意:Runtime 缺失时,绝不能让 Agent 自己手搓一个"审片台"网页来顶替——真实发生过一次,Agent 手制的界面与产品账本格式完全不兼容,等于白做一遍。这个项目明确要求:产品不可用时,停止就是停止。

Q5:剪辑结果总是不合我心意?这是项目最值得称道的自进化机制。你在审核页里的每一次恢复、补删,都会被记录进偏好文件:口味差异写进cut-preferences.md,专名错误补进词典,规则空白记进"待升级判例"。下次剪辑,AI 就会按你的风格来。

动手之前,先准备好这三样东西

通读全文后你会发现,这个工具的核心设计哲学是"判断与执行分离":AI 只负责理解和判断,物理剪切永远等你确认。这既保证了安全,也让每一刀都有据可查。

现在就可以开始你的第一次尝试,动手前请先确认:

  1. 一台 macOS 或 Windows 10/11 的机器,Bun、Node.js、ffmpeg、Chrome 四样依赖齐备
  2. 一个火山引擎 API Key,用于云端逐词转录
  3. 一段你自己的口播原素材,最好是清晰、单人的,首次体验效果最佳

然后对 Agent 说"安装剪辑环境"完成就绪检查,再喊一声"剪口播",剩下的交给它。剪完记得在审核页多看几遍——重点看 AI 标记为"高"风险的条目,那是它自己都拿不准的地方,也是你作为人的价值所在。

【免费下载链接】chengfeng-videocut-skills用 Claude Code Skills 做的视频剪辑 Agent项目地址: https://gitcode.com/gh_mirrors/vi/chengfeng-videocut-skills

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

返回列表