ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

发现一个神仙Skill:OpenClaw 自动剪辑,素材丢进去,坐等成片

发现一个神仙Skill:OpenClaw 自动剪辑,素材丢进去,坐等成片 1. 素材丢进去就能出片video-use 到底解决了什么如果你剪过访谈、口播或者旅行 vlog大概都经历过这种循环把十几段素材拖进时间线逐条听有没有“嗯、啊、那个”剪掉前后多余的空白再手动对齐字幕最后调色加转场。单条视频可能就要一两个小时而内容本身其实没什么变化纯粹是重复劳动。video-use 这个 OpenClaw Skill 想干的事情很直接你把素材丢进一个文件夹用一句话说清楚要剪成什么样它自己完成切片、拼接、配音、字幕和导出。它支持访谈、蒙太奇、教程、旅行 vlog 等常见类型核心能力包括剪掉语气词、去掉语义音频前后的空白、调整片段色调、给音频加淡出、生成可自定义字幕还能对渲染结果做自我评估再改进。更实用的一点是它会把剪辑过程的上下文持久化存储任务中断后可以从断点继续不用从头再来。它适合谁适合手里有大量素材、但不想把时间耗在重复操作上的内容创作者也适合想跑通一条自动化剪辑链路的开发者。这篇会从 Skill 配置骨架讲到可复制参数再演示一次从素材到成片的完整验证动作目标是让你照做就能跑通。2. 为什么 video-use 的成本能压下来大多数模型处理视频的方式是逐帧理解画面token 消耗非常高一条几分钟的视频成本就很难扛。video-use 换了个思路它不“看”视频而是先通过 ElevenLabs Scribe 把视频里的音频转成文本输出到文件再让模型去理解文本内容从而知道这段素材在讲什么。同时它会按需对素材抽帧作为辅助信息提供给模型。这个设计的好处是模型做的是它最擅长的事——理解文本而不是硬啃像素。所以整体成本会低很多效果也不差。理解了这个原理后面的配置和排障就顺了音频转录质量直接决定剪辑质量ffmpeg 负责所有切片拼接和导出ElevenLabs 负责配音和转录。3. 前置准备TaoToken 与依赖环境在动手之前先把两件事准备好模型调用通道和本地依赖。模型调用这边我用的是 TaoToken它提供统一的 API 入口兼容常见的对话与编码模型调用方式适合拿来驱动 video-use 里的理解与生成环节。官网地址是 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content API 入口是 https://taotoken.net/api 。你需要先去控制台创建一个 API Key后面配置里会用到。本地依赖主要是 ffmpeg 和 ElevenLabs 的 API Key。ffmpeg 负责切片、拼接、转码、加字幕是整个链路的执行引擎ElevenLabs 负责音频转录和配音生成。这两样缺一不可。3.1 安装 ffmpegWindows 下可以用 winget 或直接下载压缩包解压后加入 PATHwinget install Gyan.FFmpegmacOS 用 Homebrewbrew install ffmpegLinux 用 aptsudo apt update sudo apt install -y ffmpeg装完验证一下ffmpeg -version能打印出版本号就说明可用了。3.2 获取 ElevenLabs API Key进入 ElevenLabs 官网注册登录后在左侧菜单栏找到最下方的“开发者”切到“API 密钥”这个 Tab点击“创建密钥”按钮把生成的 Key 复制保存好。这个 Key 在安装 Skill 时会被要求粘贴后面转录和配音都会用到。3.3 准备 TaoToken API Key进入 TaoToken 控制台创建一个 API Key。如果你后面要跑长期编码或 Agent 任务可以顺带了解一下 Coding Plan入口在 https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewrite 。创建好的 Key 先放好配置环节会写进环境变量。4. 安装 video-use Skill 与配置骨架video-use 支持在 OpenClaw、Hermes、WorkBuddy、QClaw 等环境里使用安装方式有两种让助手自动安装或者自己手动装。推荐第一种省事。4.1 自动安装把下面这段命令直接丢给你的助手它会自己去读安装说明并完成配置Set up https://github.com/browser-use/video-use for me. Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent youre running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because thats where the editing scripts live. After install, dont transcribe anything on your own — just tell me its ready and wait for me to drop footage into a folder.执行过程中它会让你粘贴 ElevenLabs API Key粘贴后继续等它提示 ready 就装好了。这里有个细节值得注意命令里明确要求它读完 SKILL.md 和 helpers/ 目录因为真正的剪辑脚本都在 helpers/ 里不读的话后面调用容易出问题。4.2 手动配置骨架如果你想自己控制配置可以参考下面这个骨架。核心是把模型通道、转录服务和 ffmpeg 路径都写清楚# video-use 配置骨架 skill: video-use model: provider: taotoken base_url: https://taotoken.net/api api_key: ${TAOTOKEN_API_KEY} model: gpt-4o-mini # 用于理解转录文本与生成剪辑方案 transcribe: provider: elevenlabs api_key: ${ELEVENLABS_API_KEY} model: scribe ffmpeg: path: ffmpeg output: resolution: 1920x1080 fps: 30 format: mp4 editing: remove_fillers: true # 剪掉嗯、啊、呵等语气词 trim_silence: true # 去掉语义音频前后空白 audio_fade_out: 30 # 音频淡出秒数 color_boost: true # 片段色调增强 subtitle: true # 生成字幕 transition: cross_dissolve # 转场类型把${TAOTOKEN_API_KEY}和${ELEVENLABS_API_KEY}换成你实际的 Key或者写成环境变量引用。参数说明如下参数作用建议值remove_fillers剪掉语气词truetrim_silence去空白trueaudio_fade_out音频淡出30color_boost色调增强truetransition转场cross_dissolveresolution输出分辨率1920x1080配置写好后把素材放进一个文件夹比如D:\coze\video-use\demo然后给助手下发任务即可。5. 验证请求从素材到成片的完整动作配置好之后跑一次完整验证。我准备了几段电影片段素材放在D:\coze\video-use\肖申克的救赎目录下然后给助手下发任务我的视频素材位于 D:\coze\video-use\肖申克的救赎 这个目录下面视频的内容是《肖申克的救赎》电影里面的一些片段我希望你可以以瑞德Red的口吻讲述安迪Andy在肖申克监狱中的故事把素材剪辑成一段视频。下发后video-use 的执行链路是这样的第一步扫描文件夹分析每段素材的时长和内容摘要。这一步它调用 ElevenLabs Scribe 把音频转成文本再让模型读文本所以你能看到它输出的摘要其实是基于台词的。第二步输出剪辑方案包括整体结构、风格、片段顺序。它会问你确认分辨率、总时长、是否需要字幕等信息。这一步别跳过确认清楚能少返工。第三步确认后开始剪辑。ffmpeg 按方案切片、拼接、加转场、混音最后渲染导出。成片默认落在素材目录下的edit\preview.mp4。我这次渲染出来的第一版转场有点突兀过渡不自然。于是让它调整转场它给片段之间加入了交叉溶解音频也做了交叉淡入淡出再看就顺多了。这个迭代过程本身就是 video-use 的自我评估改进能力在起作用。如果你想单独验证 ffmpeg 链路是否通可以手动跑一条命令测试切片ffmpeg -i input.mp4 -ss 00:00:10 -to 00:00:25 -c copy clip_01.mp4能正常切出片段说明 ffmpeg 环境没问题剩下的交给 Skill 就行。6. 本篇常见错排查跑这条链路时最容易卡在几个地方我按出现频率排一下。ffmpeg 找不到或版本过低。报错通常是ffmpeg: command not found或者某些滤镜不支持。先跑ffmpeg -version确认版本建议 5.0 以上。Windows 下如果装了但助手找不到检查 PATH 是否生效必要时在配置里写 ffmpeg 的绝对路径。ElevenLabs Key 无效或额度不足。转录阶段直接失败报 401 或 429。去开发者面板确认 Key 是否被禁用以及当月额度是否用完。转录是整条链路的第一步这里挂了后面全停。素材音频质量差导致转录错乱。video-use 靠转录文本理解内容如果素材底噪大、多人重叠说话转录出来的文本会很乱剪辑方案自然不准。建议先用 ffmpeg 做一次降噪再入库ffmpeg -i raw.mp4 -af afftdnnf-25 clean.mp4转场生硬。默认转场可能不适合所有素材尤其是节奏差异大的片段。在配置里把transition改成cross_dissolve并适当加长重叠时长观感会自然很多。任务中断后重跑。video-use 会持久化剪辑上下文中断后重新下发同一任务它会从断点继续不用重新转录。如果发现它从头开始检查素材目录和输出目录是否被改动过。模型调用报错。如果用的是 TaoToken 通道确认 base_url 写的是https://taotoken.net/apiKey 没有多余空格。需要排查接入问题时可以去 API Keys 页面重新生成一个 Key 对比测试接入文档在 https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewrite 有详细说明。7. 按场景选对入口把链路跑顺这条链路跑通之后你会发现它真正的价值不在于“自动”而在于把模型放在它擅长的地方——读文本、做决策把重复的像素操作交给 ffmpeg。素材丢进去确认一下方案坐等成片中间省掉的是大量机械操作。如果你主要是在排障和接入阶段建议先把 API Keys 和接入文档过一遍入口分别是 https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewrite 和 https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewrite 。想先验证模型对话效果可以去模型对话页面试一条请求https://taotoken.net/chat?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewrite 。如果你打算把这类剪辑任务做成长期跑的编码或 Agent 流程Coding Plan 会更合适https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewrite 。最后留一个我踩过的坑第一次跑的时候我没确认分辨率就让它开剪结果导出的是竖屏素材全是横屏画面两边大黑边。后来养成习惯方案确认那一步一定把分辨率、时长、字幕三项看清楚再点继续能省一次重渲染。
返回列表