
3步跑通 VoxCPM2从完整安装到第一句语音合成与零样本克隆【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPMVoxCPM2 是一款免分词器的多语言语音合成系统通过扩散自回归架构直接从文本生成连续语音。这篇笔记带你三步走通装好环境、跑通第一句语音合成再给出一条零样本语音克隆命令。 先看效果VoxCPM2 语音合成能产出什么先看你会拿到什么。模型跑完后产出是一个标准 wav 文件48kHz 采样率不需要外部超分辨率工具任何音频播放器、剪辑软件直接打开就能用。除了基础合成2B 官方模型还支持 30 种语言含中文和粤语、四川话等 9 种中文方言可以只用一句自然语言描述凭空造一个新音色也可以从一段短参考音频里克隆出指定声音。下图是这套语音合成系统的端到端流程全景文本进入中间建模连续语音表示最后输出音频波形。 VoxCPM2 安装环境要求与两种安装命令装之前确认环境是否满足系统Windows、Linux、macOS 均可Python3.10 及以上需低于 3.13硬件建议 NVIDIA GPUVoxCPM2 显存占用约 8GBCPU 能跑但速度慢网络首次运行需联网自动从模型库下载权重推荐用 PyPI 安装一行命令会连带装好 torch、soundfile 等依赖pip install voxcpm # 从 PyPI 安装最新版依赖自动解析需要最新开发版本时从源码安装# 克隆仓库后以可编辑方式安装 git clone https://gitcode.com/GitHub_Trending/vo/VoxCPM cd VoxCPM pip install . 跑通第一个结果VoxCPM2 Python API 与 CLI 调用把下面这段存成 .py 文件运行即可产物是 demo.wav。首次运行会下载模型权重之后走本地缓存import soundfile as sf from voxcpm import VoxCPM # 加载官方 2B 模型首次自动下载跳过降噪器加载以节省显存 model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) # cfg_value 引导强度默认 2.0inference_timesteps 扩散步数默认 10越大音质细节越好 wav model.generate( textVoxCPM2 是一款多语言语音合成模型。, cfg_value2.0, inference_timesteps10, seed42, # 固定随机种子结果可复现 ) sf.write(demo.wav, wav, model.tts_model.sample_rate) # 按模型输出采样率 48kHz 保存等价的命令行写法voxcpm design是不用参考音频的纯文本合成交互# --cfg-value、--inference-timesteps 分别对应 Python 里的两个同名参数 voxcpm design \ --text VoxCPM2 是一款多语言语音合成模型。 \ --cfg-value 2.0 --inference-timesteps 10 \ --output demo.wav对应关系上--text对应generate()的text入参--output指定输出路径加--seed可固定随机种子。 它是怎么工作的扩散自回归架构拆解VoxCPM2 是tokenizer-free路线的代表不先把语音离散成 token而是直接在 AudioVAE V2 的连续隐空间里建模绕开了离散化带来的信息损失。内部流水线分四级LocEnc 编码文本与参考音频TSLM文本-语义语言模型生成语义表示RALM残差声学语言模型逐层补全声学细节最后 LocDiT 用 flow matching 把表示解码成波形。两层语言模型之间通过 FSQ 标量量化约束做隐式的语义-声学解耦兼顾表现力和稳定性。因为全程在连续表示上操作模型能根据文本内容推断合适的韵律和情绪输出听起来贴合语境AudioVAE V2 采用非对称编解码参考音频 16kHz 输入、48kHz 原生输出。️ 调优与进阶玩法cfg_value、推理步数与语音克隆命令生成阶段值得动的参数其实就两个参数默认值调高调低cfg_value引导强度2.0更严格贴合文本与参考风格听感偏紧更放松自然但可能偏离提示inference_timesteps扩散步数10声学细节更好耗时增加出音更快适合快速草稿seed随机固定后同一文本多次生成结果一致—进阶用法有三个入口命令行示例各一条Voice Design造音色文本开头加括号描述如(年轻女性温柔甜美的声音)你好欢迎体验 VoxCPM2无需任何参考音频可控克隆传reference_wav_path克隆音色的同时仍可用括号指令调节语速和情绪命令行克隆voxcpm clone --text 这是一段克隆音色演示 --reference-audio ref.wav --output clone.wav参考音频和输出路径各给一个文件即可 图形化入口启动 Web 界面不想写代码的话源码仓库自带 Gradio 界面因此这一节需要先完成源码安装python app.py --port 8808启动后浏览器打开http://localhost:8808输入文本、选择克隆模式就能出声加--device可指定 auto、cpu 或 cuda 运行设备。 下一步延伸资料README_zh.md中文完整文档含版本对比与基准数据想全面摸清模型能力时看scripts/train_voxcpm_finetune.pySFT / LoRA 微调入口脚本想用自己的数据适配特定音色时看conf/voxcpm_v2/voxcpm_finetune_lora.yamlLoRA 微调配置模板需要自定义训练超参时看app.pyWeb 界面源码想改造或集成界面逻辑时看把上面示例里的文本换成你自己的话再跑一遍听听 demo.wav 的实际效果如果对默认音色不满意丢一段参考音频进去克隆你要的声音。【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考