ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Vosk 离线语音识别指南:三步装好,把任意音频转成文字

Vosk 离线语音识别指南:三步装好,把任意音频转成文字 Vosk 离线语音识别指南三步装好把任意音频转成文字【免费下载链接】vosk-apiOffline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node项目地址: https://gitcode.com/GitHub_Trending/vo/vosk-api会议室没信号、音频里有敏感数据不能上传云端语音转文字怎么办Vosk 就是为这类场景准备的离线语音识别 API识别在本地完成音频不经过任何服务器。它支持 20 多种语言语言模型只有 50MB 左右从树莓派、手机到服务器集群都能跑。如果你要做实时字幕、离线语音助手或者想给 App 加上语音输入这个项目值得放进你的工具箱。特性速览模型小能力却不小完全离线隐私可控识别全程在本地设备执行医疗记录、内部会议这类敏感音频可以安心处理。流式识别零延迟响应把音频按块喂给识别器就能边说边出结果适合实时字幕和语音助手这类需要即时反馈的场景。多语言覆盖英、中、日、法、德、西、俄、土耳其、越南、阿拉伯等 20 语言每种语言都能独立下载对应模型。跨语言绑定齐全核心是 C 实现见 src/官方提供 Python、Java、Node.js、C#、Go、Ruby 等绑定android/ 和 ios/ 目录下有现成的移动端工程。三步跑起来装依赖、下模型、转第一条音频第一步安装 Python 模块其他语言绑定可跳过这步直接看对应目录的 READMEpip install vosk第二步从官方网站的模型库下载对应语言模型如 en-us解压到本地目录备用。第三步把仓库里的示例拉下来对照着改克隆命令git clone https://gitcode.com/GitHub_Trending/vo/vosk-api然后写一个最小脚本一条 WAV 就能转出来import wave from vosk import Model, KaldiRecognizer model Model(langen-us) wf wave.open(test.wav, rb) rec KaldiRecognizer(model, wf.getframerate()) while True: data wf.readframes(4000) if len(data) 0: break if rec.AcceptWaveform(data): print(rec.Result()) print(rec.FinalResult())注意 Vosk 要求音频是 16bit 单声道 PCM 的 WAV 格式格式不对时建议先用 ffmpeg 转一下。实战场景字幕、批量转写、说话人分离视频自动配字幕。python/example/test_srt.py 演示了完整链路用 ffmpeg 把任意视频抽成 16kHz 单声道音频流再交给识别器的SrtResult方法直接得到带时间轴的 SRT 字幕。想接麦克风做实时转写可以看同目录下的 test_microphone.py。大批量音频文件处理。一段段跑KaldiRecognizer够用但文件一多批量识别接口效率更高。Go 侧的 go/batch_example/ 展示了BatchModelBatchRecognizer的用法还能用GPUInit()开启 GPU 加速C 核心实现见 src/batch_model.cc。区分不同说话人。识别之外Vosk 附带说话人识别能力。python/example/test_speaker.py 加载说话人模型配合SpkModel输出这句话是谁说的底层实现在 src/spk_model.cc。做会议纪要、访谈整理时这正好补上谁在什么时候说了什么里缺的一半。进阶技巧让识别更快、更准按场景选模型。资源受限的设备树莓派、手机用小型模型内存占用低、加载快追求准确率再上大模型。同一语言往往有多档可选先小后大是最稳的路线。用词表约束降噪。如果你的识别范围很确定——比如只识别数字指令——可以在创建识别器时传入词表 JSON并用SetGrammar动态更新。参考 python/example/test_words.py词表收敛后误识别会明显减少。打开词级结果方便做高亮和纠错。rec.SetWords(True)之后结果里会带上每个词的时间戳做字幕对齐、关键词高亮都靠它见 test_simple.py。调试期建议SetLogLevel(-1)关掉日志噪音定位问题再调回 0 看细节。下一步从示例目录开始最直接的入口是 python/example/里面每个脚本都是独立可跑的完整案例改个参数就能实验Node.js 用户从 nodejs/demo/ 起步Go 用户看 go/example/。模型下好、示例跑通你就已经具备搭建离线语音应用的全部积木了 【免费下载链接】vosk-apiOffline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node项目地址: https://gitcode.com/GitHub_Trending/vo/vosk-api创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表