ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

TMSpeech 免费完整指南:Windows 离线实时语音转文字如何快速上手

TMSpeech 免费完整指南:Windows 离线实时语音转文字如何快速上手 TMSpeech 免费完整指南Windows 离线实时语音转文字如何快速上手【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech上周开会你被点名时愣了几秒——前面十分钟的讨论一个字没记下来。TMSpeech 解决的就是这个问题它是一个 Windows 上的离线实时语音转文字工具直接捕获电脑播放的内音在本地用 sherpa-onnx 识别成字幕不需要麦克风也不需要联网。三件事决定它好用内音采集不挑设备识别结果全程不出本机历史句子按时间戳落盘到本地日志。下面按先跑通再选场景最后调参数的顺序介绍。能力速览TMSpeech 能做什么能力一句话说明适用场景系统内音采集通过 WASAPI Loopback 录制电脑播放的声音关到静音也能采会议、网课、视频配音麦克风采集采集外置或内置麦克风输入面对面讨论、课堂速记进程音频采集只录指定进程发出的声音多窗口同时开时只盯一个应用离线识别内置 Sherpa-Onnx CPU 识别器断网可用无网络环境、隐私敏感场合命令行识别器启动你的外部程序用 stdout 协议回传结果接入自研模型或云端服务字幕窗口无边框、可任意拖动和调整大小贴在视频、会议窗口旁边历史记录每句话带时间戳可搜索、右键或 Ctrl-C 复制会后回看、整理纪要日志落盘自动写入我的文档下的 TMSpeechLogs二次加工成字幕稿、笔记三步跑通 TMSpeech1. 解压并运行从 Release 页面下载最新版压缩包解压到任意目录避免放在受保护的系统目录。双击运行TMSpeech.exe在桌面建一个快捷方式方便日常使用。确认成功屏幕角落出现无边框的字幕窗口任务栏托盘有图标。2. 配置识别模型打开设置页托盘图标右键切到资源标签页查看当前已安装的 sherpa-onnx 模型。Release 安装包通常已内置模型如需更换在识别器配置的下拉框里选自定义模型再分别指定编码器、解码器、连接器和词表四个文件路径。确认成功设置页能列出至少一个可用模型或四个文件路径都能选中有效文件。3. 验证识别点击字幕窗口上的开始按钮随便播放一段有声视频或对着麦克风说话。确认成功字幕窗口滚动出现文字停顿了约 2 秒后当前句停止滚动表示一句已落定。场景用法四种典型用法会议实时转录适用场景线上会议想留一份完整记录但腾不出手做笔记。操作步骤设置页选择音频源为系统内音。把字幕窗口拖到会议窗口角落调小字体不挡屏幕。点击开始按钮整场会议持续识别。散会后打开历史记录页右键复制关键段落完整文本在同日期的日志文件里。推荐配置配置项建议值原因音频源系统内音只录电脑发出的声音不采环境噪音自动开始开开机即录不漏开场日志路径默认 TMSpeechLogs文件名带启动时间一天一场不覆盖网课与播客笔记适用场景自己说话多答疑、口头笔记或想录电脑里的课程内容。操作步骤有外部声音选麦克风源只录课程内容选系统内音。讲到的关键点在历史记录页搜索关键词定位。选中句子按 Ctrl-C 复制粘进笔记软件。推荐配置配置项建议值原因音频源麦克风采集口头复述与问答字体大小24-32字幕窗口常驻不占太多屏幕敏感词留空或填导师名字被点名时弹出通知视频配音字幕制作适用场景给录播或直播回放做字幕稿人工听写太慢。操作步骤音频源选系统内音让字幕窗口覆盖在播放器上。播放视频实时字幕作为校订依据。结束后打开对应日期的日志文件每行时间: 句子就是现成的字幕时间轴可直接整理成 SRT。推荐配置配置项建议值原因背景色半透明黑压在视频上可读字体颜色白与深色背景对比度足够文字对齐居中更像标准字幕条敏感词提醒与开机常驻适用场景会议里听到自己的名字或项目代号立刻收到提醒。操作步骤设置页找到敏感词多个词用逗号或换行分隔。通知类型保持系统命中时 Windows 弹通知且当句不再更新。勾选开机启动和启动时自动开始全程无感录制。推荐配置配置项建议值原因敏感词名字、项目代号逗号分隔即可开机启动开配合自动开始全天待命进阶配置真正值得调的参数参数默认值影响开机启动LaunchOnStartup关控制是否随系统登录启动启动时自动开始StartOnLaunch开程序启动后不点按钮就开始识别结果日志路径ResultLogPath我的文档\TMSpeechLogs每次启动生成一个yy-MM-dd-HH-mm-ss.txt字体/字号/颜色/对齐48 号白字左对齐字幕窗口外观改完即时生效敏感词空命中即弹通知并停止当前句更新识别器模型内置默认下拉框选已装模型或自定义模型填四个文件内置断句规则写在代码里不可调了解后能解释为什么这句被切了长句需约 2.4 秒静音、短句约 1.2 秒静音即断句单句超过 80 字也会强制断。命令行识别器另有四项命令、参数、工作目录、日志文件。它启动你的外部程序把标准输出当作识别流标准错误写进日志文件。它的 stdout 协议只有一个约定单个换行表示当前句的临时结果连续两个换行表示当前句定稿只有定稿的句子才进历史记录和日志。这样模型有机会在后面纠正前面的临时结果。bat 脚本记得开头加隐藏命令回显结尾不要pause否则会检测不到退出。示例脚本可参考 external_recognizer 目录。常见问题速查症状可能原因处理方法点击开始提示找不到模型文件资源页未装模型或自定义路径写错资源页安装模型或核对四个文件路径字幕一直不动选了内音源但电脑没声音或音量被静音到 0 仍无输出放一段有声内容测试改用麦克风源临时结果被改掉流式识别的正常行为后到的更准无需处理定稿句才是最终结果命令行识别器提示命令异常退出外部程序启动失败或崩溃先设日志文件查看 stderr 内容参数含空格路径启动失败命令行参数未转义给含空格的参数加双引号行为怪异、改配置无效配置文件损坏运行 Release 包里的重置配置 bat删除现有配置文件开发者专区插件系统与核心接口TMSpeech 的音频源、识别器、翻译器都是插件内置三个Windows 音频采集内音/麦克风/进程、Sherpa-Onnx 离线识别器、命令行识别器源码在 src/Plugins/。程序启动时扫描 plugins 目录逐个读取 tmmodule.json用独立的 AssemblyLoadContext 加载程序集并实例化 IPluginTMSpeech.Core 在所有插件间共享插件不能反向依赖 GUI 项目。运行时数据流是一条事件链音频源 DataAvailable → JobManager → 识别器 Feed() → TextChanged实时刷新字幕/ SentenceDone落日志、进历史 → ViewModel → 字幕窗口、历史记录写一个识别器插件核心是实现 IRecognizerpublic interface IRecognizer : IRunable { event EventHandlerSpeechEventArgs TextChanged; // 实时结果 event EventHandlerSpeechEventArgs SentenceDone; // 定稿句子 void Feed(byte[] data); // 接收音频 void LoadConfig(string config); // 加载 JSON 配置 }其余四步创建类库项目引用 TMSpeech.Core在后台线程做识别、通过事件发结果实现 IPluginConfigEditor 让设置页自动生成表单提供 tmmodule.json 描述模块编译输出到 plugins/你的插件名/ 即可。更完整的加载、配置、异常流程见 docs/Process.md接口定义见 IRecognizer.cs。后续与反馈路线图上的方向包括翻译器插件、更多语言模型和跨平台适配。对识别准确率不满意时优先换一个更合适的流式模型再试想接入自研模型用命令行识别器即可。功能建议、bug 和插件讨论都走项目的 Discussion 与 Issue 区代码可 clone 到 https://gitcode.com/gh_mirrors/tm/TMSpeech 后直接提 Pull Request。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表