ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

TMSpeech:Windows离线语音转文字实时字幕,会议纪要救星实战笔记

TMSpeech:Windows离线语音转文字实时字幕,会议纪要救星实战笔记 TMSpeechWindows离线语音转文字实时字幕会议纪要救星实战笔记【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeechTMSpeech 是一款 Windows 离线语音转文字工具捕获电脑正在播放的声音实时转成文字上屏。全程本地运行、不联网哪怕把音量彻底关到零识别照样进行——这是它最戳我的一个特点。开会走神被点名是我最真实的场景上个月一场 45 分钟的需求评审我走神大概走了 20 分钟。产品经理突然cue我刚才那段你怎么看我大脑一片空白只能硬着头皮说同意。散会后回看其实那 20 分钟里有一个关键变更跟我负责的部分直接相关。我当时想的不是一款录音软件——录完还是要听 45 分钟音频——而是能立刻读到的文字。字幕要够快记录要能翻这才是刚需。后来我找到了 TMSpeech。它捕获电脑播放的声音实时转成歌词式字幕显示在屏幕上走神几分钟瞟一眼字幕就能接回话题散会后打开历史记录把整场会议翻出来整理成纪要。五分钟跑起来它没有安装向导也不要求注册账号。从项目仓库的 Release 页面下载最新压缩包解压后运行TMSpeech.exe就能跑想用源码自己构建的话执行git clone https://gitcode.com/gh_mirrors/tm/TMSpeech。首次运行做三件事打开设置切到资源标签页给中文模型点安装约 300MB只需一次回到主窗口点红色按钮开始识别识别结果会按日期自动存进我的文档的TMSpeechLogs文件夹配置文件在%AppData%/TMSpeech/config.json正常使用完全不用手动碰。Release 包附带一个重置配置的 bat 脚本配置改乱了跑一下就能回到出厂状态新手最担心的调坏了怎么办基本不存在。三种音频源怎么选你想听什么音频源决定声音从哪来内置三种各自对应一类场景Windows 系统内录捕获电脑正在播放的全部声音底层是 WASAPI CaptureLoopback。适合会议软件、在线课程、视频播放。附带一个很实用的效果系统音量静音也不影响识别因为音频是从系统内部直接取的Windows 麦克风输入录你自己的说话声。适合语音笔记、口述草稿Windows 进程音频只录指定程序的输出其他应用一律忽略。适合只想盯某一个播放器或会议客户端。注意它要求较新的 Windows 版本Win11 或 21H2 及以上一句话建议大多数人用系统内录就够了覆盖面最广只有明确要录自己或某个特定程序时才切另外两种。识别引擎怎么选语言模型怎么装设置里切到语音识别标签页就是识别器选择区。内置三类离线语音转文字引擎定位差异很明显Sherpa-Onnx 离线识别器默认项为普通 CPU 优化装好模型即用。大多数人保持它Sherpa-Ncnn 离线识别器支持 GPU 加速对识别速度和资源占用有更激进要求的用户试试命令行识别器面向高级用户的开放接口。它启动一个外部子进程把子进程的标准输出当字幕文本读标准错误输出写日志文件几乎任何能输出文字的识别程序都能接进来下面这张截图是设置页面的语音识别区域重点看中间的识别器下拉框和下方的模型配置项。引擎是发动机模型是燃料。设置里的资源标签页集中管理模型安装目前提供 Zipformer-transducer 系列的中文、英文、中英双语模型每项旁边就是安装按钮中文模型体积在 300MB 级别装完会显示已安装。内置模型不合口味也不死路去 sherpa-onnx 的预训练模型列表挑一个更合适的流式模型回设置里改模型路径即可。字幕显示与历史记录点开始之后电脑里的声音就变成屏幕上的实时字幕。字幕是一个无边框小窗口可任意拖动、调整大小右键能改字体、字号、颜色、透明度、阴影。把它贴在视频下方或会议窗口旁边基本不挡内容。下面是运行中的识别窗口就一行当前语音简单到没有学习成本。与此同时识别结果按句子落盘到我的文档/TMSpeechLogs每次识别一个文件。开完会打开当天文件稍作整理会议纪要就有了。历史记录页面支持右键或 Ctrl-C 复制摘关键段落很方便。还有个容易忽略的功能设置通知标签页里可以填敏感词某句话里出现就弹桌面通知。把同事的昵称填进去会议里被提到就立刻有提示挺香的。命令行识别器把自己的识别程序接进来内置引擎都不满意的话命令行识别器的扩展空间最大。它的协议很简单子进程标准输出里以单个换行\n结尾的行是临时结果用于更新当前句子以多个换行\n\n结尾的行是最终结果会被存入历史记录标准错误输出写入日志文件双方统一 UTF-8 编码这个设计允许模型边出字边纠正临时结果可以被后续结果改写最终留下的是一条稳定的完整句子。参考 Python 脚本放在 external_recognizer/ 目录改改就能跑起来。有几个容易翻车的细节命令行识别器模式下子进程独立获取音频设置里的音频源切换不生效程序参数用空格分隔路径里带空格要用双引号转义指定 bat 脚本时开头加隐藏命令回显结尾别写pause会导致无法检测进程退出⚡️## 真实感受与关键数据体感上作者实测在 AMD 5800u 笔记本上 CPU 占用不到 5%我连挂一场一个半小时的会风扇几乎没有动静电池消耗也在预期内。音频按 16kHz 单声道采集识别链路是边说边出字的节奏滞后感基本察觉不到——不依赖网络往返响应天然就快。讲真短板也有识别准确率很大程度取决于模型。普通话标准的时候基本可用但环境嘈杂、多人抢话、口音重的场景错字会明显变多。好在模型只有 300MB 级别换模型试错的成本很低。 踩坑与高频问题录不到系统内音。多数情况不是 TMSpeech 的问题而是 Windows 音频设备设置。打开声音控制面板的录制标签页启用立体声混音设备没显示就右键空白处勾选显示禁用的设备。识别准确率不理想。先排查环境环境音太吵、多人同时说话、音量不合适再确认音频源选对没有。都正常的话多半是模型和场景不匹配换一个模型或去 sherpa-onnx 预训练列表找更合适的流式模型在设置里改模型路径。历史记录找不到。检查我的文档/TMSpeechLogs文件夹是否存在、有无写入权限。权限异常时以管理员身份运行程序通常能解决。CPU 占用偏高。配置一般的机器选 Sherpa-Onnx 识别器、换轻量模型能省下一部分开销。命令行识别器没输出。九成是协议问题临时结果要以单个\n结尾句子结束要补一个空行。先翻它写入的 stderr 日志一般能直接定位。掀开引擎盖TMSpeech 的代码是核心框架 功能插件结构。核心在 src/TMSpeech.Core/管插件加载、任务调度、配置和资源具体功能放在 src/Plugins/ 下每个插件目录里有一个tmmodule.json自述文件程序启动时扫描plugins目录按描述加载对应程序集。音频链路大致是WASAPI 低延迟采集 →JobManager接收音频 → 识别器的Feed()方法流式识别 →TextChanged/SentenceDone事件更新界面。配置是 JSON 文件且支持热重载改完字幕样式立刻生效不用重启。这套机制意味着新增一个音频源、识别引擎或翻译功能只需实现对应接口再放进插件目录核心代码一行不用动IAudioSource IRecognizer ITranslator项目用 C# 加 Avalonia 编写结构清晰想读源码的话是个友好的仓库。回到开头那个走神的场景现在开会我会让 TMSpeech 后台挂着被点名时瞟一眼字幕就能接上话散会后翻历史记录十分钟写完纪要。它免费、开源、离线装好后几分钟就能干活。如果你正好需要一款 Windows 离线语音转文字工具或者只是想让自己开会走神得安心一点可以拉下来试试。项目对反馈很开放用得不顺手直接提 Issue发现了效果更好的开源模型也欢迎推荐给项目方。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表