ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GPT-SoVITS 模型部署完整指南:预训练模型从下载到出声音

GPT-SoVITS 模型部署完整指南:预训练模型从下载到出声音 GPT-SoVITS 模型部署完整指南预训练模型从下载到出声音【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS如果你已经克隆了 GPT-SoVITS 仓库但pretrained_models目录还空空如也这篇指南就是为你写的。它解决的核心问题是GPT-SoVITS 预训练模型怎么下载、放在哪里、配置文件怎么写、版本怎么换。读完后你可以独立跑通一次语音合成并且知道后续换版本、更新模型时该动哪些文件。快速上手三步跑通第一次语音合成第一次跑不需要手动下载任何东西WebUI 会替你处理启动入口在仓库根目录执行python webui.py。启动时程序会扫描本地缺失的模型文件并自动调用内置脚本去拉取终端里能看到下载进度。等它落盘所有文件默认进入GPT_SoVITS/pretrained_models/目录。你可以顺手进目录确认一下文件大小是否正常几百 MB 到 1 GB 量级。验证结果在 WebUI 里随便输一句话点合成。听到声音说明模型加载、配置、推理链路全部通了。 如果某次下载中断不用删目录重下——重新运行webui.py未完成的文件会补全。选对模型版本v1 到 v4 怎么匹配你的场景选型时先问自己两个问题对音色的要求有多高、机器跑得动吗。下面是按场景反推版本的对照表你的场景推荐版本对应的解码器权重设备吃紧只要求能用v1s2G488k.pth常规合成质量与速度均衡v2s2G2333k.pth想要情感更丰富、更自然v2Pro / v2ProPluss2Gv2Pro.pth/s2Gv2ProPlus.pth追新架构想要最新效果v3 / v4s2Gv3.pth/s2Gv4.pth补充一点背景每个版本都由「GPT 部分把文本转成语音语义」和「VITS 部分一种常见的神经声码器负责把语义还原成波形」两段权重组成上面列的是 VITS 段的文件名。没有显卡时优先 v1 或 v2有独显且在意表现力直接上 v2Pro 或 v4。把模型文件落盘自动与手动两条路线路线一WebUI 自动下载。就是上面快速上手里的方式适合网络通畅的环境零配置。路线二手动放置文件。当网络受限、自动下载反复失败时把模型文件从别的渠道拿到后按约定目录放好即可。以 v4 为例为什么要放进gsv-v4-pretrained子目录因为配置文件里写的就是这个相对路径mkdir -p GPT_SoVITS/pretrained_models/gsv-v4-pretrained cp /path/to/s2Gv4.pth GPT_SoVITS/pretrained_models/gsv-v4-pretrained/放完文件后直接启动 WebUI 验证不需要改任何代码。读懂配置tts_infer.yaml 关键字段逐个讲配置都在 GPT_SoVITS/configs/tts_infer.yaml。每个版本对应一个顶层块如v2:外加一个custom:块描述「当前实际使用哪套」。六个核心字段各管一件事bert_base_path中文 RoBERTa 模型路径负责文本语义理解注意它指向的是一个目录而非单个文件。cnhuhbert_base_pathChinese HuBERT 路径负责从音频里提取内容特征。t2s_weights_pathGPT 段权重版本间文件名差异很大换版本时最容易漏改的就是它。vits_weights_pathVITS 声码器权重也就是上一节表格里列的那些.pth。device填cuda或cpu决定推理跑在哪里。is_halfFP16 半精度开关只有 GPU 下开启有意义能省显存还能提速。模型切换与维护换版本和增量更新如何切换模型版本版本切换不靠换文件靠改配置打开tts_infer.yaml把custom块里的version改成目标版本比如v4然后重启 WebUI才生效——配置是启动时一次性读入的改完不重启等于没改。各版本块的字段结构一致所以也可以把目标版本的整块内容拷进custom一步到位。增量更新怎么做官方发布补丁时通常只换一两个权重文件。此时不必全量重下只要用补丁文件覆盖同路径下的旧权重例如重新下载s2Gv4.pth放回原目录即可。有一条例外要注意推理代码和模型版本是配套的。v3、v4 的权重要用 export_torch_script_v3v4.py 这条线做导出或处理老版本脚本不认新结构。升级模型时顺手确认一下对应脚本能省掉不少排查时间。出问题时看这里3 个高频问题及修复问题一启动报FileNotFoundError症状日志里指向某个模型路径。原因是配置写的路径和磁盘上实际位置对不上。修复按报错路径去pretrained_models/里找文件不存在就按上一节的手动路线补齐目录权限异常时检查是否可读常规 755 即可。问题二有显卡却跑得很慢症状GPU 利用率几乎为零。原因是device还留着cpu或is_half没开。修复确认 CUDA 可用后把对应版本块的device改为cuda、is_half改为true再重启。问题三显存/内存不够直接崩溃症状合成几句就 OOM。原因是大版本 半精度在低配机器上吃不消。修复换 v1 这类轻量版本或退回 CPU 模式长文本分段合成也能明显压低峰值占用。收尾4 条长期维护建议把这几件事做掉后面换模型基本不会踩坑依赖先备齐合成前先确认requirements.txt相关依赖装好环境干净换完必验证每次换版本后跑一次短文本合成确认能出声再干别的改动前备份动tts_infer.yaml前先复制一份原配置出问题可秒回滚记录在用版本在自己的笔记里记下当前版本与权重文件名排查问题时会感谢自己【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表