ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

faster-whisper 如何上手:一条命令装好 4 倍速的语音转文字引擎

faster-whisper 如何上手:一条命令装好 4 倍速的语音转文字引擎 faster-whisper 如何上手一条命令装好 4 倍速的语音转文字引擎【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 是 OpenAI 语音识别模型 Whisper 的提速重制版底层换成 CTranslate2 这个专为 Transformer 优化的推理引擎可以把它理解成专门打磨过的执行引擎转写同样一段音频最多快 4 倍占用的内存也更小。如果你有会议录音、课程音频、访谈素材要批量变成文字这个库值得一试。读完这篇你能在电脑上装好它并跑出第一条转写结果。整个过程四步走自检环境 → 三步安装 → 首跑验证 → 调参数提速。全程只装 pip 包不需要 GPU普通电脑用 CPU 就能跑通。先看清楚faster-whisper 能做什么输出带起止时间的句子级结果可再拆到单词级时间戳自动识别音频语言不用手动指定用 PyAV 解码音频内部自带 FFmpeg 库所以不用像原版 openai/whisper 那样单独安装 FFmpeg内置 Silero VAD 语音活动检测自动跳过长时间静音默认见 vad.pyPython 编写要求 Python 3.9CPU / GPU 都能用环境自检动手前核对这 3 件事项目必须推荐Python3.9 及以上python3 --version查看3.11硬件任意 CPU 电脑小模型 4GB 内存够用NVIDIA GPUCUDA 12、8GB 显存跑大模型磁盘1GB 空闲装包 缓存小模型预留 5GB 给 large 级别模型权重安装配置三步装好 faster-whisper步骤一确认 Python 版本先确认版本达标不达标就先升级 Python再往下走python3 --version看到Python 3.9.x或更高就通过。「注意」Windows 上python和python3可能指向不同环境用哪个命令能打印出 3.9 就用哪个。步骤二建虚拟环境一条命令装包创建隔离环境并安装 faster-whisper所有依赖会一起拉下来python3 -m venv whisper-env source whisper-env/bin/activate # Windows 用 whisper-env\Scripts\activate pip install faster-whisper装完立刻验证能导入、能打印版本号没有报错即成功python -c import faster_whisper; print(faster_whisper.__version__)步骤三可选开启 NVIDIA GPUGPU 推理需要 cuBLAS 和 cuDNN 两个 NVIDIA 计算库。Linux 上可以直接用 pip 装并在启动 Python 前设置好库路径pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.* export LD_LIBRARY_PATHpython3 -c import os; import nvidia.cublas.lib as c, nvidia.cudnn.lib as d; print(os.path.dirname(c.__file__) : os.path.dirname(d.__file__))「注意」新版 ctranslate2 只支持 CUDA 12 cuDNN 9。你的环境是 CUDA 11 / cuDNN 8 的话先执行pip install --force-reinstall ctranslate23.24.0降级。没有 GPU 直接跳过本步CPU 版完全可用。首次运行验证跑出第一条转写结果把下面脚本保存下来audio.mp3换成你本地任意音频mp3、wav、flac 都支持再运行from faster_whisper import WhisperModel model WhisperModel(tiny, devicecpu) segments, info model.transcribe(audio.mp3) print(识别语言:, info.language) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})首次运行会从 Hugging Face 自动下载 tiny 模型权重几十 MB稍等片刻。看到[0.00s - 2.50s] 文字内容...这样的时间戳 文本输出就算跑通了。「注意」transcribe返回的是生成器不进入 for 循环就不会真正开始转写。调参提速最常改的 4 个参数模型尺寸WhisperModel第一个参数tiny / base / small / medium / large-v3越大越准也越慢。先用 tiny 跑通流程再换大模型。compute_type精度CPU 给int8、GPU 给int8_float16内存大约减半GPU 不指定时默认 float16。beam_size解码时保留的候选条数默认 5。调大到 10 更稳但更慢调小到 1 追求速度。vad_filter / vad_parameters默认开启静音过滤。停顿特别多的音频可把min_silence_duration_ms调到 500长音频提速明显。全部参数含义见 transcribe.py 里的函数签名。卡点排查4 个高频报错的解法现象首跑卡住很久才动 原因在下载模型权重首次才有之后走本地缓存 解决等它下完即可弱网环境可用包里的download_model函数提前下载现象devicecuda报找不到 CUDA 库或直接崩溃 原因cuBLAS / cuDNN 没装或 cuDNN 版本不是 9.x 解决按步骤三补齐老 CUDA 11 环境把 ctranslate2 降到 3.24.0现象调用了 transcribe 却没有任何文字输出 原因segments 是惰性生成器没有迭代就不执行 解决用 for 循环遍历或先segments list(segments)现象CPU 上跑 medium 以上模型内存不足 原因模型与中间数据占内存太大 解决改compute_typeint8或换小一号模型并用OMP_NUM_THREADS限制线程数跑通到这里faster-whisper 的核心流程就已经在手里了。下一步建议试word_timestampsTrue拿单词级时间戳或用批量转写接口BatchedInferencePipeline处理成百上千个文件想对比各实现的真实速度仓库的 benchmark/ 目录里有现成的压测脚本。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表