ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

5秒录音做多语言配音:OpenVoice语音克隆30分钟上手

5秒录音做多语言配音:OpenVoice语音克隆30分钟上手 5秒录音做多语言配音OpenVoice语音克隆30分钟上手【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice想让某位博主的声音说出一整套多语言旁白传统做法是每种语言各请一位配音或者用对方几小时的录音去训模型。OpenVoice 把这件事压缩成一次语音克隆给它一段5秒的干净录音它就能把对方的音色提炼成一个向量之后你说中文、英文、日文都会用那个人的声音念出来。它帮你省掉的是整套训练流水线和多语种录音成本。拿到仓库到生成第一句克隆语音只要三步 整个流程像一间配音棚基础语音引擎先录粗配音色转换器再做最终配音把目标音色换到粗配上。先建一个隔离的 Python 3.9 环境克隆仓库并装上依赖conda create -n openvoice python3.9 -y conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .再下载 V2 模型权重并装上它依赖的 MeloTTSMyShell 团队出品的多语言文本转语音库和日语分词数据wget https://myshell-public-repo-host.s3.amazonaws.com/openvoice/checkpoints_v2_0417.zip unzip checkpoints_v2_0417.zip -d checkpoints_v2 pip install githttps://github.com/myshell-ai/MeloTTS.git python -m unidic download版本时间线顺带一提2023 年底的 V1 率先做到零样本音色克隆和风格控制2024 年 4 月的 V2 换了更激进的训练策略音质更好原生支持英语、西语、法语、中文、日语、韩语六种语言许可证也转成 MIT商用免费。打开一个 Notebook跑下面这段代码。核心思路一句话先用默认嗓音生成基础语音再把音色换成你要克隆的那个人。import torch from openvoice import se_extractor from openvoice.api import ToneColorConverter from melo.api import TTS device cuda:0 if torch.cuda.is_available() else cpu converter ToneColorConverter(checkpoints_v2/converter/config.json, devicedevice) converter.load_ckpt(checkpoints_v2/converter/checkpoint.pth) # 1) 从参考录音里蒸馏目标音色se tone color embedding音色调色板向量 my_se, _ se_extractor.get_se(resources/example_reference.mp3, converter, vadTrue) # 2) 用默认嗓音生成基础语音再换上目标音色 model TTS(languageEN, devicedevice) spk_id next(iter(model.hps.data.spk2id.values())) model.tts_to_file(Hello, this is my first cloned sentence., spk_id, tmp.wav) spk_key next(iter(model.hps.data.spk2id)).lower().replace(_, -) src_se torch.load(fcheckpoints_v2/base_speakers/ses/{spk_key}.pth, map_locationdevice) converter.convert(tmp.wav, src_se, my_se, output_pathmy_first_clone.wav)播放my_first_clone.wav——这句话不再出自默认嗓音而是你参考录音里的那个人。图中文字先进基础说话人 TTS 生成基础语音音色提取器同时从参考音频里提炼音色中间的流模块流匹配 Flow Matching让基础语音平滑迁移到目标音色的生成方法完成替换最后输出带目标音色的语音。从一句话到多语言配音它能帮你做什么 用英文录音说中文文本参考音频的语言和输出文本的语言不需要相同这就是零样本跨语言克隆换掉文本和基础语音的语言即可音色保持不变。model_zh TTS(languageZH, devicedevice) zh_spk_id next(iter(model_zh.hps.data.spk2id.values())) zh_spk_key next(iter(model_zh.hps.data.spk2id)).lower().replace(_, -) model_zh.tts_to_file(今天天气真好我们一起去公园散步吧。, zh_spk_id, tmp_zh.wav) converter.convert(tmp_zh.wav, torch.load(fcheckpoints_v2/base_speakers/ses/{zh_spk_key}.pth, map_locationdevice), my_se, output_pathcloned_zh.wav)适用场景你只有一段海外讲师的英文介绍录音却要给课程中文站录旁白——换语言不换人。️ 语速和语气随你调风格由基础语音决定而不是克隆器V1 的 BaseSpeakerTTS 用speaker参数切换语气可选 friendly、cheerful、sad、angry、whispering 等预设speed控制语速base_tts.tts(text, tmp.wav, speakerwhispering, languageEnglish, speed0.9)V2 则是每种语言备有多位基础说话人换一位就换一种说话感觉。适用场景同一句文案宣传片里要耳语感发布会里要高能量。 起个网页在浏览器里克隆不写代码也能跑一条命令启动 Gradio 页面上传参考音频、填文本、点生成。python -m openvoice_app --share适用场景给不懂代码的同事演示效果或者自己快速试听不同参考音频的差距。声音不对劲时5个高频坑与调法现象get_se一步报错提示 Silero VAD 下载失败。原因语音活动检测VAD自动切出人声片段的组件用的模型首次要联网下载。解法手动下载 silero-vad 的 zip 包解压到~/.cache/torch/hub/snakers4_silero-vad_master详见 常见问题。现象输出语音有底噪、破音。原因参考音频带背景噪音、多人同说或有大段静音。解法换成5~15秒单人干净录音。现象换了参考音频出来的还是旧音色。原因se_extractor会把提炼结果按文件名缓存在processed目录同名文件不会自动覆盖。解法参考音频起个新名字或清掉该缓存目录。现象生成语音的口音、情绪和参考人不一致。原因OpenVoice 只克隆音色口音和情绪由基础语音模型决定不在克隆范围内。解法换一位对应口音的基础说话人或接入自己训练的基础模型。现象想克隆的语言不在六语支持列表里。原因内置基础语音只覆盖六语而音色转换本身不限语言。解法用其他 TTS 当基础语音即可仓库里 跨语言示例 就是这个思路。这套能力往哪用三个落地思路多语言课程批量生产录一段主讲人自我介绍批量生成同一声音的中、英、日旁白配音成本从每语种一位演员降到一段录音。对外发布时建议给convert加个message参数converter.convert(tmp.wav, src_se, my_se, output_pathout.wav, messagemy-project)它会往音频里嵌入一条隐形水印日后可以溯源这段声音出自你的流水线。有声书角色化不同参考音频对应不同角色一个项目里让同一个人分饰多角后期统一音色只需统一参考录音。个人化助手给自己的数字助手换上自己的声音。项目团队自用的 MyShell 平台已把这套能力做成了工作坊界面建个机器人、进入语音克隆设置、上传音频就能得到一个可复用的克隆声音。在工作坊里点击Create a Bot进入语音克隆设置即可生成并管理自己的克隆声音。平台还配套了 TTS 小部件按语言、音色筛选后直接挂到机器人上适合不想写代码的使用者。TTS 小部件按语言与音色筛选基础语音选中即可在机器人里直接使用。延伸材料都放在仓库里安装与快速上手、常见问题、风格控制示例、跨语言克隆示例、V2 多语言示例、许可证MIT。现在找一段自己的5秒录音听听你的AI分身说出第一句话。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表