ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

完全离线的语音转文字新选择:免费开源的 Handy,5 分钟上手实测

完全离线的语音转文字新选择:免费开源的 Handy,5 分钟上手实测 完全离线的语音转文字新选择免费开源的 Handy5 分钟上手实测【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy市面上的语音转文字工具多到挑花眼但真正能做到完全离线、免费开源、还能在 Windows、macOS、Linux 上通吃的一只手就数得过来。Handy 就是其中之一——装上它、按一下快捷键、开口说话文字就出现在你正在用的任意输入框里全程不碰网络。这篇文章不搞教科书那套就当个用过的朋友带你把它跑起来。先回答一个扎心的问题你的录音凭什么交给云端保管用手机自带的语音输入或者找个网页端的免费转录服务看起来确实方便——但你想过吗你的每一次口述其实都在被上传到别人的服务器上加工。语音里藏着你的口音、习惯、工作内容甚至是不经意间说出口的隐私。这不是危言耸听这是很多免费工具真实的运行方式。Handy 选择了一条相反的路所有识别都在本地电脑上完成。它给自己的定位官方就写了四个词免费、开源、私密、简单。免费无障碍工具应该属于所有人而不是被付费墙挡在门外开源代码完全公开你可以检查它、改它甚至把它 fork 成自己想要的样子私密录音和转录结果都不出设备断网也能用简单只干一件事——把你说的话变成文字放进文本框。用大白话讲它不靠收集你的语音盈利所以压根没动机惦记你的数据。安装的三种姿势选一个就能跑起来给普通用户最省事的是直接下载对应系统的安装包装完即用。喜欢用包管理器的也有现成方案macOS 用户brew install --cask handyWindows 用户winget install cjpais.Handy想折腾或者想定制的人也可以从源码构建git clone https://gitcode.com/GitHub_Trending/handy11/Handy cd Handy npm install npm run tauri dev整个过程几分钟搞定。装完先别急着录音下面这份启动清单值得先过一遍。第一次开口前把这份启动清单过一遍首次启动Handy 会引导你完成两件关键的事允许麦克风权限没有它软件听不见你说话授予辅助功能权限这是它能把文字贴进其他应用的关键少了这一步转录结果就只能待在它自己的窗口里。接着确认两件事一是快捷键。默认是 CtrlSpaceWindows/Linux或 OptionSpacemacOS按一下开始录音、再按一下结束。不顺手设置里随时改还能换成按住说话、松开停止的 Push-to-talk 模式。二是模型。Handy 支持多套本地识别模型第一次用选哪套可以参考这张表模型特点适合谁Whisper Small轻量快速日常随手记追求低延迟Whisper Medium速度与准确率均衡大多数人的稳妥默认项Whisper Turbo / Large准确率更高支持 GPU 加速专业场景机器性能够好Parakeet V3纯 CPU 可跑自动识别语言没有独显的老机器有个小提示如果电脑没有独立显卡Parakeet V3 是你的亲妈选项——它在中端 CPU 上能做到大约 5 倍实时速度基本感受不到等待。几个小开关让识别结果更懂你很多人以为装完就结束了其实 Handy 的不少本事藏在设置里调好之后体验完全不同。先说降噪。它内置了基于 Silero 的语音活动检测VAD能自动过滤沉默和背景噪音——你在咖啡馆里说话它只听你不听邻桌。再说实时转录。新版本支持流式模型比如 Parakeet Unified、Nemotron Streaming意味着你边说、它边出字不用等整段说完。配合新的转录悬浮窗你能实时看到文字生成的过程还有几个值得打开的小开关自定义词汇专业术语、人名、产品名总被识别错手动加进词汇表下次立刻变准后处理自动去掉嗯那个之类的语气词、补上句尾空格、转写完自动提交——都是可勾选的选项多语言识别支持 20 多种语言中英文切换不用换工具界面语言也能跟着系统走。三类人已经换不掉它自由撰稿人把稿子说出来思路不再被打字速度打断十分钟口述出半小时的量回头再改稿记者和产品经理开会时开着它散会直接拿到一份文字记录不用边听边记手部不便或视障的朋友则把语音输入当作日常的键盘——这恰恰是它诞生的初衷一个真正的无障碍工具。有意思的是Handy 的开发者自己说过它没打算做成最好用的语音转文字软件而是想做最容易被 fork 的那一个——给社区一个可以自由改造的地基。这也是为什么从识别模型到处理引擎它全链路开源喜欢折腾的人完全可以拆开研究核心逻辑在src-tauri/src/下。避坑小抄遇到问题先看这里最后把新手最容易踩的三个坑提前告诉你识别结果不准先别急着怪软件。换个模型试试——准确率不够就上 Whisper Large机器跑不动就换 Parakeet再把自定义词汇用起来多数顽固错误都能解决。快捷键没反应检查是否和系统或其他软件的快捷键撞了去设置里换一个组合即可macOS 上想用 Globefn键触发得是 Apple 键盘才行第三方键盘触发不了这是硬件限制不是 Bug。Linux 上文字贴不进去大概率是缺了文本注入工具X11 装xdotoolWayland 装wtype或dotool装完重启即可。今晚就能做的下一步下载安装 → 授予权限 → 选 Parakeet V3 → 按 CtrlSpace → 说一句完整的话。整个过程不会超过五分钟而你的语音数据全程没有离开过这台电脑——这大概就是它最珍贵的地方。【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表