ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

FunASR 离线语音转写:Windows 本地部署 64 路并发实操手册

FunASR 离线语音转写:Windows 本地部署 64 路并发实操手册 FunASR 离线语音转写Windows 本地部署 64 路并发实操手册【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASRFunASR 是达摩院语音实验室推出的开源语音识别工具包覆盖语音转写、语音活动检测VAD、标点恢复PUNC等全链路能力。在 Windows 上做本地部署即可跑通完全离线的语音转写音频不出本机、无需 GPU16 核 CPU 能支撑 64 路并发。上图为 FunASR 的整体布局模型库、训练推理库、运行时与服务层四层Windows 用户日常打交道的主要是后两层。没有显卡能不能跑数据会不会出本地部署 ASR 服务前大多数人最关心两个问题要不要显卡、音频数据去哪里。不需要 GPUWindows SDK 2.0 支持中/英文离线文件转写纯 CPU 即可运行适合企业本地化部署数据留在本地语音数据完全在本机处理不上传云端适合金融客服、医疗记录、司法审讯等隐私敏感场景性能有具体数字16 核 CPU 服务器支持 64 路并发请求实时率RTF低至 0.0076输入格式省心集成 FFmpegwav、mp3、mp4 等常见音视频可直接转写无需预先转码Windows 离线语音识别部署前要准备什么硬件配置怎么选档位CPU 核心内存支持并发适用场景基础4 核8GB32 路个人 / 小团队标准16 核32GB64 路部门级应用企业64 核128GB200 路大规模集群系统与软件要求操作系统Windows 10/11 专业版64 位运行时.NET Framework 4.8 或更高版本容器Docker Desktop for Windows需启用 WSL2 后端家庭版用户需先开启 WSL2步骤可查微软官方文档离线转写服务怎么启动部署流程是「拉取项目 → 一键脚本 → 验证」三步全程只需按脚本提示选项。1. 拉取项目并进入部署目录git clone https://gitcode.com/GitHub_Trending/fun/FunASR.git cd FunASR/runtime/deploy_tools2. 执行一键部署脚本双击运行funasr-runtime-deploy-offline-cpu-zh.bat同目录另有 shell 版funasr-runtime-deploy-offline-cpu-zh.sh适合 WSL / Git Bash 环境按提示完成配置模型类型1 基础转写2 带时间戳转写3 热词增强服务端口默认 10095可自定义工作目录建议选 D 盘等非系统盘避免权限问题如果提示docker: command not found先安装 Docker Desktop 并重启电脑。服务启动后每条音频会走完整离线转写链路语音端点检测 → 声学模型解码 → 标点预测 → 逆文本规范化ITN输出带标点、数字已规范化的文本。3. 验证服务状态浏览器方式打开http://localhost:10095能看到服务状态页即部署成功命令行方式curl http://localhost:10095/health预期返回{status:healthy,version:2.0}。转写任务怎么调用单文件、批量与 Web 界面单文件转写仓库在runtime/python/websocket目录提供了 Python WebSocket 客户端python funasr_wss_client.py --host 127.0.0.1 --port 10095 --mode offline --audio_in C:/meeting_recording.wav --use_itn 1常用参数--audio_in支持 wav/mp3/mp4 等格式也支持网络音频 URL--use_itn 1开启数字规范化例如 123 输出为「一百二十三」--hotword指定热词文件路径提升专业术语识别准确率批量文件处理先建一个wav.scp文件每行「标识 路径」例如会议记录1 C:/audio/meeting1.mp3。转写时把--audio_in指向该 scp 文件并追加--output_dir C:/transcripts结果会统一落到指定输出目录。免代码的 Web 界面在浏览器打开runtime/html5/static/index.html即可上传文件转写或实时录音转文字适合不想写代码的场景。生产化调优并发、长音频与日常运维线程与内存怎么调解码线程数 ≈ CPU 核心数 ÷ 2IO 线程数 ≈ 核心数 ÷ 4。例如 16 核机器可设为 8/4funasr-runtime-deploy-offline-cpu-zh.bat update --decode_thread_num 8 --io_thread_num 4超过 1 小时的超长音频启用分片处理... update --max_single_audio_length 3600按行业换用专用模型医疗damo/speech_paraformer-large_asr_nat-zh-cn-16k-medical-vocab5000-pytorch金融damo/speech_paraformer-large_asr_nat-zh-cn-16k-financial-vocab8404-pytorch通过update --asr_model 模型名替换服务管理命令与日志操作命令启动funasr-runtime-deploy-offline-cpu-zh.bat start停止funasr-runtime-deploy-offline-cpu-zh.bat stop重启funasr-runtime-deploy-offline-cpu-zh.bat restart状态funasr-runtime-deploy-offline-cpu-zh.bat status服务日志在workspace/logs目录性能方面可用 Windows 性能监视器跟踪 CPU 与内存占用。更细粒度的部署参数可查 离线部署进阶文档。三个高频问题端口被占用容器闪退、日志报 port is already allocated用netstat -ano | findstr :10095找到占用进程再执行taskkill /PID 进程ID /F强制结束转写准确率不理想到 模型列表 换更新的模型在workspace/hotwords.txt中按「热词 权重」逐行添加热词用 Audacity 等工具把音频统一为 16kHz 采样率防火墙拦截执行netsh advfirewall firewall add rule nameFunASR dirin actionallow protocolTCP localport10095放行入站端口这套本地方案目前主要落在四类需求上金融客服质检、医疗语音病历、司法审讯转写、教育课堂字幕。后续版本计划补充多语言混合转写、GPU 加速、实时自定义词典更新以及更丰富的 API 与 SDK。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表