ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

MOSS-Transcribe-Diarize字幕工作台实战:视频上传、字幕校对到MP4烧录一站式流程

MOSS-Transcribe-Diarize字幕工作台实战:视频上传、字幕校对到MP4烧录一站式流程 MOSS-Transcribe-Diarize字幕工作台实战视频上传、字幕校对到MP4烧录一站式流程【免费下载链接】MOSS-Transcribe-DiarizeA 0.9B model for long-form transcription in 50 languages with speaker diarization, timestamps, and acoustic event awareness项目地址: https://gitcode.com/gh_mirrors/mo/MOSS-Transcribe-DiarizeMOSS-Transcribe-Diarize 是一款开源的 0.9B 音频理解模型其内置的字幕工作台MOSS Subtitle Studio让你无需拼接多套工具上传视频或音频 → 自动转写并分离说话人 → 在线逐句校对 → 一键导出 SRT/ASS 或直接烧录成带字幕的 MP4。本文用一次真实工作流带你从零跑通这条一站式字幕流水线。认识 MOSS 字幕工作台转写与说话人分离一步到位传统做法是ASR 转写 VAD 切分 说话人分离三套系统拼接时间戳经常对不齐。而 MOSS-Transcribe-Diarize 在一次推理中同时输出带时间戳和说话人标签的转写结果标准格式为[0.48][S01]大家好欢迎来到本期访谈[3.21][3.55][S02]谢谢我们开始吧[6.90]每个片段都有起止秒数和[S01]、[S02]等说话人标签天然就是一份子字幕subtitle数据源。它支持 50 种语言面向会议、访谈、播客、讲座等长时多说话人场景。整个 Web 应用由一个 FastAPI 服务驱动代码入口在 web_cli.py路由定义在 server.py字幕格式转换SRT/ASS/JSON则在 subtitle/export.py 中实现。一键安装与启动步骤5 分钟部署本地字幕工作台⚠️ 烧录 MP4 功能需要系统已安装ffmpeg与ffprobe在 PATH 中可访问即可检测逻辑见 ffmpeg.py。第 1 步获取代码git clone https://gitcode.com/gh_mirrors/mo/MOSS-Transcribe-Diarize cd MOSS-Transcribe-Diarize第 2 步准备干净的 Python 3.12 环境并安装uv venv --python 3.12 .venv source .venv/bin/activate uv pip install -e .[torch-runtime] --torch-backendauto第 3 步启动字幕工作台mtd-subtitle-web \ --model OpenMOSS-Team/MOSS-Transcribe-Diarize \ --host 127.0.0.1 \ --port 7860浏览器打开http://127.0.0.1:7860即可进入界面。界面支持简体中文与英文首次会跟随浏览器语言也可通过页头语言选择器即时切换并记住偏好。 如果你已有部署好的 vLLM 服务可加--backend vllm --vllm-base-url http://127.0.0.1:8000/v1复用远程推理避免本地重复加载模型。上传视频自动转写并分离说话人点击左侧导入媒体按钮选择本地文件即可。支持的格式包括mp4 / mov / mkv / wav / mp3 / m4a等常见音视频类型。上传后任务状态会依次经过状态含义排队中 / 加载模型模型首次加载到 GPU/CPU转写中正在推理进度条实时刷新处理中解析时间戳、切分字幕片段待校对✅ 转写完成进入工作台界面右上角的推理参数折叠区可以调整Prompt、输出 tokens、上下文上限、解码方式greedy/sample、温度——默认值不用改只有长音频被截断时才需要调大输出 tokens后点击重新转写。任务列表支持随时删除或新建任务后台由 jobs.py 管理任务生命周期。字幕校对界面详解逐句改词、改名、调样式转写完成后进入三栏工作台① 左侧视频预览 字幕表格上方视频播放器会随播放进度高亮当前字幕方便逐句听音对词下方表格列出每个片段的开始时间 / 结束时间 / 说话人 / 字幕文本全部可直接点击编辑。② 右侧检查器Inspector说话人名称把[S01]映射成主持人嘉宾 A等真实名字导出和烧录时都会自动替换样式组字号18–96、底边距、是否显示说话人、按说话人分色改完记得点保存修改状态栏会显示已保存。③ 多说话人同框不打架当两个片段时间重叠时layout.py 的assign_overlap_lanes会自动为字幕分配车道上下错开排列避免互相遮挡。导出字幕与 MP4 烧录最后一公里校对完成后右侧输出区域会生成 4 份文件点击下载即可文件用途raw_transcript.txt模型原始转写文本segments.json结构化片段数据方便二次开发subtitle.srt通用 SRT 字幕可挂到播放器subtitle.ass带样式的 ASS 字幕用于烧录烧录 MP4点击醒目的烧录视频按钮后台调用 FFmpeg 以libx264 -crf 18高质量编码音频流直接复制几秒钟内产出output.mp4命令构造见 ffmpeg.py 的burn_ass_subtitles。如果页面提示FFmpeg 不可用安装好 ffmpeg/ffprobe 后刷新即可状态徽标会实时显示检测结果。所有产物统一保存在runs/目录下按任务分文件夹方便归档。进阶命令行批量烧录不用打开网页批量处理视频时一条命令就能完成转写 → 导出 → 烧录全流程mtd-subtitle /path/to/input.mp4 \ --model OpenMOSS-Team/MOSS-Transcribe-Diarize \ --out-dir runs/example \ --render该命令对应 cli.py--render开启后会同时输出raw_transcript.txt、segments.json、subtitle.srt、subtitle.ass和烧录好的output.mp4并在终端打印一份 JSON 摘要。适合放进脚本做批量流水线。常见问题速查长音频字幕末尾缺失界面会提示可能截断把输出 tokens从 2048 调大如 8192后点击重新转写即可说话人颜色怎么调样式组里把颜色从统一切到按说话人不同说话人会自动分配 8 组预置色见 export.py 的SPEAKER_COLORS专业术语识别不准在推理 Prompt 末尾追加热词提示热词1, 热词2可显著提升专有名词准确率界面语言切换页头下拉框选中文/English选择会被记住中英文文案维护在 locales/。小结MOSS-Transcribe-Diarize 的字幕工作台把转写、校对、导出、烧录压缩进一个本地网页模型端一次性输出时间戳 说话人标签界面端提供可视化逐句校对与样式定制FFmpeg 完成最后的 MP4 压制。对会议记录、访谈节目、播客剪辑等场景来说这套流程让字幕生产从多工具拼接变成一条命令、一个页面。【免费下载链接】MOSS-Transcribe-DiarizeA 0.9B model for long-form transcription in 50 languages with speaker diarization, timestamps, and acoustic event awareness项目地址: https://gitcode.com/gh_mirrors/mo/MOSS-Transcribe-Diarize创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表