ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Whisper.cpp 快速上手指南:5 分钟跑通本地语音转文字

Whisper.cpp 快速上手指南:5 分钟跑通本地语音转文字 Whisper.cpp 快速上手指南5 分钟跑通本地语音转文字【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cppWhisper.cpp 是 OpenAI Whisper 的纯 C/C 移植让离线语音识别完全在你自己的机器上跑起来不用 Python、不用框架、零外部依赖。从移动端到桌面本地语音转文字几行命令就能搭好。一条命令跑通识别 不用服务端、不用网络、不用密钥整个过程就是 5 行命令git clone https://gitcode.com/GitHub_Trending/wh/whisper.cpp cd whisper.cpp sh ./models/download-ggml-model.sh base.en cmake -B build cmake --build build --config Release ./build/bin/whisper-cli -f samples/jfk.wav最后一条命令跑完终端会打印出 JFK 那段著名讲话的文字——离线语音识别已经在本地跑通了全程几分钟。想再省事一点直接make base.en也能一条命令完成下模型加推理。快在哪三个卖点先记着够用跨平台全覆盖macOS、iOS、Android、Linux、Windows、WebAssembly、树莓派、Docker 都能跑一套核心代码同时服务移动端和桌面应用。零运行时内存分配推理过程不做动态分配资源占用可预期天然适合嵌入式和低内存设备。硬件加速Apple Silicon 走 NEON/Accelerate/Metal/Core MLNVIDIA 走 CUDA还支持 Vulkan桌面端推理速度可再翻几倍。挑对模型省一半内存 模型越大越准但磁盘和内存也跟着涨官方口径是这样的模型磁盘占用内存占用tiny75 MiB~273 MBbase142 MiB~388 MBsmall466 MiB~852 MBmedium1.5 GiB~2.1 GBlarge2.9 GiB~3.9 GB经验是日常英文转写用 base 起步追求精度再往上走。如果资源还是紧用整数量化Whisper.cpp 量化模型能让磁盘和内存再小一截精度损失通常可以接受./build/bin/quantize models/ggml-base.en.bin models/ggml-base.en-q5_0.bin q5_0三档硬件加速开关 ⚡手上有加速硬件就别浪费——同一个项目按硬件重编译即可只差一个 cmake 开关苹果设备Metal / Core MLcmake -B build -DWHISPER_COREML1NVIDIA 显卡CUDAcmake -B build -DGGML_CUDA1跨厂商显卡Vulkancmake -B build -DGGML_VULKAN1对应哪个开关就加哪个重新编译完直接跑代码一行不用改。喂对音频少踩坑whisper-cli 目前只吃 16-bit WAV。手头的素材如果是 mp3、m4a先转成 16kHz 单声道 16 位ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav跑起来之后这几个问题最高频Q识别太慢A换 tiny.en 或 base.en 这类小规格或者打开上文的 GPU 加速开关。Q内存不够A跑量化后的模型或者直接降级到更小的规格。Q准确率不够A换 medium 或 large同时保证音频清晰、背景噪音小。还能顺手做点别的说话人分离配合 tinydiarize 模型输出里自动标记每段话是谁说的实时流字幕stream 示例每半秒采样一次麦克风音频边说边出文字音画同步视频给 whisper-cli 加-owts生成卡拉OK风格的字幕视频。写在最后whisper.cpp 是开源项目想改模型结构、调采样或识别策略直接进 src/whisper.cpp 动手就行。别光收藏——clone 下来把第一条识别结果跑出来后面都是顺的。【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表