ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

10分钟训一个专属AI音色:RVC语音克隆上手指南

10分钟训一个专属AI音色:RVC语音克隆上手指南 10分钟训一个专属AI音色RVC语音克隆上手指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI想用手机里录的十分钟语音做一个能用于短视频旁白或翻唱的AI音色开源项目 Retrieval-based-Voice-Conversion-WebUI简称 RVC干的就是这件事基于 VITS 架构的语音转换框架给它一小段语音数据就能训出一个会模仿这个音色的模型全程在浏览器里完成。 十分钟出一版可用模型传统语音克隆动辄数小时训练、几十小时数据调错了还得从头再来。RVC 的底模用接近 50 小时的 VCTK 数据集预训练过你只需提供 10-50 分钟自己的语音它用 top1 检索把输入源特征替换为训练集特征顺带解决了音色泄漏问题。 低配显卡也能跑是不是必须用高端显卡才能玩RVC 启动后会自动检测设备老显卡自动切换 fp32 降低显存占用4G 显存用batch_size为 1 也能训A 卡和 I 卡还有 requirements-dml.txt 这类专用依赖文件可装。 不用写代码也走得完需要懂深度学习吗不需要。训练、推理、模型融合都在网页界面里完成一键训练把特征提取、模型训练、索引训练一次做完还集成了 UVR5 人声分离和 RMVPE 音高提取不用另配工具。1. 环境准备三条命令跑起来基础要求✅ Python 3.8-3.10✅ 已安装 ffmpeg✅ N 卡优先A 卡、I 卡可用# 克隆仓库并安装依赖N卡用户 git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt预训练模型文件assets/ 目录、rmvpe.pt 等用tools/目录下的下载脚本获取即可。Windows 整合包用户直接双击go-web.bat。 常见卡点默认端口是 7865被占用的话启动时加--port参数换一个端口。2. 数据准备十分钟低底噪语音语音质量直接决定模型上限✅ 总时长 10-50 分钟✅ 安静环境录制❌ 背景音大、混入音乐把音频wav/mp3放进同一目录即可不用手动切片RVC 训练时会自动切分并归一化音量。 路径里带中文、空格、括号容易出现 ffmpeg error全程用纯英文路径最省心。3. 核心操作一键训练# 启动 WebUI python infer-web.py启动后浏览器自动打开。在训练选项卡填写实验名建议纯英文、选择数据目录再按下表设置参数参数推荐值说明total_epoch30-200数据音质越高可调越大batch_size显存允许的最大值显存不足就调小采样率48k质量最佳音高提取rmvpe默认效果最好点一键训练后耐心等模型文件60MB 的 pth会存到weights/目录。 训练完 weights/ 里没文件时去ckpt处理选项卡用ckpt小模型提取转换 logs 里 G 开头的检查点。4. 验证结果推理出第一句进入音色转换推理选项卡先点刷新音色选中刚训练的模型上传一段测试语音把index_rate检索特征占比设为 0.75点转换试听输出验收标准音色贴近原声但有区别无明显的电音、撕裂声对不上就先回头检查训练数据。场景一给翻唱做一版AI歌手收集 10-15 分钟干净演唱音频纯人声不带伴奏训练时开启音高否则模型无法跟随旋律用 WebUI 内置 UVR5 分离人声与伴奏index_rate 设 0.6-0.8 微调音色贴合度用升降调匹配歌曲音域后重新转换验收标准用自己唱一段熟悉的副歌输出能替代原唱使用全程音色稳定、没有电音撕裂。场景二批量统一短视频的旁白声线录制一段完整的旁白原声同时作为训练素材按上面的流程训练专属旁白音色进入批量推理选项卡选择原始录音所在文件夹整文件夹处理输出到指定目录抽听几条成品再导入剪辑时间线验收标准输出文件与输入一一对应整条系列音色统一音量与原声听感一致。排错速查Connection Error终端窗口被关掉了 → 保持终端开着Cuda out of memory显存不足 → 训练调小 batch_size推理调小 configs/config.py 里的 x_pad、x_query、x_center训完找不到音色没刷新或误用了 logs 里的大检查点 → 点刷新音色选 weights/ 下 60MB 的文件ffmpeg error / utf8 error路径带特殊字符 → 目录改成纯英文无空格哑音、电音多数据底噪大却训了太多轮 → total_epoch 降到 20-30更多问题可查 docs/cn/faq.md。显存建议 batch_size说明4G1可用6G2-4甜点区间8G 以上8从容训练第一个模型不必完美重要的是建立对参数的感觉。下一步很明确打开终端跑上面第一条命令让今晚就有自己的音色可用。卡住了可以去官方 Discord 社区提问响应很快。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表