
Buzz 完整指南:本地免费语音转文字,离线音频转录一次讲清【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费开源的桌面工具,基于 OpenAI Whisper 在本地完成离线音频转录与翻译:音频文件、视频文件、麦克风实时录音都能转成文字,全程不上传、不依赖云端。它适合需要整理会议记录、制作视频字幕、处理敏感录音的用户,唯一的门槛是先选对 Whisper 后端和模型大小。一张表看懂 Buzz 的关键信息项内容做什么音频/视频/YouTube 链接 → 文字,支持转写与翻译成英文运行方式完全本地运行;首次需联网下载模型,之后可纯离线技术栈Python 3.12 PyQt6,Whisper 家族四种后端平台Windows / macOS(仅 Apple 芯片)/ Linux许可证MIT导出格式TXT / SRT / VTT,插件可加 DOCX适合谁会议记录、字幕制作、播客整理、命令行自动化用户先把 Buzz 装到电脑上Windows / macOS:从项目发行版页面下载对应安装包(Windows 为安装程序,macOS 为 .dmg)。两点注意:Windows 安装包未做代码签名,装的时候出现安全警告,选「更多信息」→「仍要运行」即可,属正常现象。macOS 版本已要求 Apple 芯片;Intel 老机器的最后可用版本是 1.4.5。Linux:Flatpak 一条命令装好:flatpak install flathub io.github.chidiwilliams.BuzzSnap、Appimage 同样支持,细节见 docs/docs/installation.md。开发者(从 PyPI 装):前提是先装好 ffmpeg 并使用 Python 3.12 环境:pip install buzz-captions python -m buzz第一次转录:三步出字导入:文件菜单的 Import Media File(或 Ctrl/Cmd O),音频、视频文件都行——Buzz 自动抽取音轨,不用手动转格式;也可以直接粘贴 YouTube 链接。配置:任务选 Transcribe(转写)或 Translate to English(译成英文);语言建议手动指定,官方明确提示自动检测偶尔会出偏差;模型按机器性能选,下一节细说。运行:点 Run,状态变成 Completed 后双击该行打开转录查看器,逐句核对时间戳,再导出 TXT、SRT 或 VTT。四种典型用法给视频批量出字幕:导入视频 → 任务选 Transcribe → 语言指定 → 运行 → 导出 SRT/VTT,直接丢进剪辑软件。批量场景走命令行,一条命令可传多个文件或整个文件夹,用--output-directory把字幕统一输出到指定目录。会议/讲座实时录音:切到 Live Recording,选好麦克风点 Record,文字边说边出;还能打开演示窗口(Presentation window)把实时字幕投到另一块屏,现场分享很方便。想录电脑里正在播放的声音,需要 BlackHole(macOS)、VB CABLE(Windows)这类虚拟声卡,分平台的配置步骤在 docs/docs/usage/2_live_recording.md。多人对话分清发言人:转录完成后在查看器里点「Identify speakers」,每句话会被自动标上说话人标签,可以试听任意发言人的 10 秒片段来确认,并把标签改成真名。注意 Intel 芯片的 macOS 不支持此功能。自动化流水线:CLI 一条命令完成转写,可写进脚本:buzz add --model-type whispercpp --model-size small --srt --vtt presentation.mp4再配合「监视文件夹」(目录新增文件自动建任务)和 Skip Already Transcribed 插件(转过的文件自动跳过),就是完整的批量流水线。全部参数见 docs/docs/cli.md。时间戳和字幕不对齐时,用查看器里的 Resize 工具重排分段、延长每条字幕的显示时长:另外,把转录译成中文等非英文语言要用 AI 翻译:在偏好里配置任何 OpenAI 兼容接口(本地跑的 Ollama 也可以),官方估算一小时音频的翻译成本约 1 美元;Whisper 自带的翻译只支持译成英文。模型怎么选:先认清四种后端后端特点适合谁WhisperOpenAI 官方实现,准但慢,吃内存不赶时间、内存充裕Whisper.cppC 实现,任意品牌 GPU 可加速(Vulkan),核显也能实时转写集显电脑、实时录音、MacFaster Whisper比官方版快一个量级,显存占用小有 6GB 显存的 Nvidia 卡Hugging FaceTransformers 实现,支持上千种语言的 MMS 模型与各类自定义模型特定语言、方言优化场景模型大小从 tiny 到 large,越大越准也越慢。官方 FAQ 给出的参考:Large-V2 最稳,Large-V3 多数情况最准但偶尔「幻觉」出音频里没有的词,Turbo 则在速度和准确率之间取平衡——最可靠的做法是拿自己的语言实际测一遍。这些坑,官方文档都替你踩过转录太慢→ 根源:模型对机器过大,或没吃到 GPU → 动作:换 tiny/base,或改用 Whisper.cpp 后端(Faster Whisper 需要 6GB 显存才划算)。PyPI 版 GPU 不生效→ 根源:默认装的是 CPU 版 torch → 动作:Windows 上按 README 改装 CUDA 版 torch 及对应 cu12 运行库。录音时报PaErrorCode-9999→ 根源:系统或安全软件拦了麦克风 → 动作:检查麦克风权限,Windows 在「设置→隐私→麦克风」里放行 Buzz。下载模型后启动崩溃→ 根源:模型文件不完整或损坏 → 动作:偏好→模型 里删掉重下。老 CPU 跑不起来→ 根源:Buzz 依赖 AVX2 指令集,过老的机器不支持 → 动作:无捷径,属硬件限制。专有名词、人名识别错→ 根源:模型缺少领域上下文 → 动作:高级设置里填 Initial prompt,把人名、术语写进去;语言已知时手动指定,别用自动检测。卡住之后往哪找使用细节:docs/docs/usage/ 下按文件导入、实时录音、翻译、编辑调整、说话人识别分好了文档常见问题:模型存在哪、离线电脑怎么迁移模型、开发版从哪下,都答在 docs/docs/faq.md想看源码:各后端实现在 buzz/transcriber/,插件机制在 buzz/plugins/,接新后端、写插件从这里入手最清楚Buzz 的定位很简单:把 Whisper 的语音转文字能力装进一个本地桌面应用,让你不上传任何音频就能拿到可编辑、可导出、可自动化的文字结果。下一步建议:先按平台装好,导入一段自己的录音跑通第一次转录,再回来对照「模型怎么选」那节为你的机器定下日常配置。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考