ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

10 分钟跑通一次 UVR5 人声提取:免费开源的伴奏分离实操笔记

10 分钟跑通一次 UVR5 人声提取:免费开源的伴奏分离实操笔记 10 分钟跑通一次 UVR5 人声提取免费开源的伴奏分离实操笔记【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI手里有首歌想在睡前拿到一条干干净净的伴奏轨好把明天要录的嗓音铺上去。用 RVC WebUI 里内置的 UVR5 人声提取一次人声伴奏分离十分钟就能跑完。说白了这就是个免费开源音频分离工具名字听着唬人流程不复杂。信号是怎么被拆成两路的一首歌录出来的波形里人声和伴奏在物理上是糊在一起的UVR5 做的事就是按频谱规律把它们拆成人声、伴奏两路输出你最后拿到的两个文件夹就是这么来的。它学的是统计规律而不是听音辨物所以拆得越狠两路互相串味就越多。伴奏里夹着几缕没抠干净的人声、人声轨里混进一点乐器声别慌残留是这类算法躲不掉的正常现象。目标从来不是完美抠净而是把残留压到你耳朵能接受的范围。从空仓库到第一次跑通先拿代码终端里执行git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI进仓库目录建一个 Python 3.12 的虚拟环境然后装依赖——这一步只看你的显卡。CPU、AMD、Intel 用户装requirments_cpu_py312.txtNVIDIA 50 系先装 CUDA 12.8 版 torch再装requirments_cu128_py312.txt更早的 N 卡对应requirments_cu118_py312.txt。装完打一句python -c import torch; print(torch.cuda.is_available())验证N 卡环境打出 True 就说明通了。卡住的话先确认虚拟环境激活了这是新手最容易忽略的一环。UVR5 的权重要单独拉一份hf download lj1995/VoiceConversionWebUI --revision main --include uvr5_weights/* --local-dir assets权重会落到assets/uvr5_weights/目录。如果这条命令卡住或报 404多半是网络或代理的事关掉代理重试一次实在拉不下来就手动把权重文件放进这个目录效果完全一样。启动界面Windows 双击根目录的go-webui.batLinux 或 Mac 直接python webui.py浏览器随后弹出主页面。点顶部「伴奏人声分离去混响去回声」这个标签右边那一屏就是后面要用的全部字段。参数只调这一个就够模型选哪个决定了参数有没有意义。HP2 和 HP3 是保留人声的一对没有和声的歌用 HP2 最均衡想让主人声更完整就换 HP3代价是可能漏掉一点伴奏歌里有和声、只想要主旋律时选 HP5主人声会略微被削弱。去混响、去回声是另一组活onnx_dereverb_By_FoxJoyMDX-Net负责双通道混响DeEcho-Normal 和 DeEcho-Aggressive 管延迟和回声Aggressive 更彻底DeEcho-DeReverb 额外去混响但耗时接近翻倍。搜人声提取参数怎么填的人很多其实只有一个字段值得你动人声提取激进程度也就是聚合度默认 10范围 0 到 20。数值往上调人声抠得更彻底可伴奏里被顺走的频段也变多听感上就是伴奏发干往下调人声更自然完整但残留更容易冒头。UVR5 聚合度怎么调没有标准答案稳的做法是每次只推 2 档跑完整段听完再决定方向来回两三圈基本就收敛了。剩下几个字段一句话带过导出格式默认 flac 无损后面还要加工就留 flac 或 wav纯存档分享选 mp3 更省地方输入框填待处理音频的目录也可以直接拖多个文件进去目录和文件二选一、目录优先两个输出文件夹保持默认 opt 就行。采样率不用管程序会把非 44.1kHz 立体声的源先转成 44.1kHz 立体声再处理源文件本身压得越狠最后能拆出的细节就越少。听感不对时先核对这三处如果你听到和声被当成主人声留了下来大概率是模型选错了——原曲带和声你却选了 HP2 或 HP3和声就会跟着人声一起留下来。换成 HP5 重跑一遍再听。反过来任务是去混响却选了 HP5等于白跑MDX-Net 那组才是干这个的。如果伴奏里人声残留明显多半是聚合度偏低从 10 朝 12 到 15 的方向推如果人声发薄、总带着一股伴奏味就朝 8 降。每次只推 2 档听完整段再推下一档比一口气拉满靠谱得多。如果整体听着闷、怎么调都到不了预期问题多半在源文件上。单声道录音、码率很低的 MP3、早就削过波的音频模型只能拆出录音里本来就存在的东西缺的信息它变不出来——换一份无损源文件重跑比调任何参数都管用。要是「输出信息」窗口直接吐了报错堆栈那是环境的事权重没进assets/uvr5_weights/、torch 版本和显卡对不上AMD 用户装错依赖文件最常见对着 docs/cn/faq.md 里对应语言的条目查一遍基本都能定位。把分离结果接进后续工作流最常见的链路是翻唱先用 HP3 把原曲跑成一条干净伴奏然后开麦录自己的人声最后在剪辑软件里把两轨叠到同一条时间轴上按进拍点对齐即可。录完的人声轨还能直接接回 RVC 主界面走变声流程等于顺手把音色也换了。播客去混响更讲究顺序先让 onnx_dereverb_By_FoxJoy 把双通道录音里的房间回声压下去再用 DeEcho-Aggressive 扫掉剩下的毛刺。两个模型串起来跑比只用其中一个干净得多。今晚就做这一件事挑一首最近循环的立体声歌曲聚合度保持默认 10 先跑一遍把两个输出文件夹各听一遍用笔把残留人声最重的那个时间点记下来。剩下的——往 12 调、往 8 调、换模型、接进工作流——等把这首歌听熟了再逐个试节奏就不会乱。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表