ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

SadTalker 安装与使用:五步完成首次音频驱动口型视频生成

SadTalker 安装与使用:五步完成首次音频驱动口型视频生成 SadTalker 安装与使用五步完成首次音频驱动口型视频生成【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一个音频驱动面部动画的开源工具输入一张人物照片和一段音频即可生成嘴型、表情与语音同步的说话视频也支持全身图。下面按环境安装、模型下载、运行推理、问题排查的顺序逐步走通。Step 1前置检查Python 版本、ffmpeg 与硬件档位动手前先确认三样东西避免装到一半才发现不兼容Python 3.8官方依赖组合在该版本下测试充分选它最不容易踩依赖冲突的坑。ffmpeg推理脚本用它读写音视频必须安装并加入PATH。硬件档位有 GPU 优先用 GPU6GB 显存如 RTX 2060即可跑 256 分辨率没有独显也能用 CPU 跑通只是速度从秒级变成分钟级。确认成功终端执行python --version显示 3.8.xffmpeg -version能正常输出版本信息即可。Step 2创建虚拟环境并安装依赖克隆仓库并搭建环境。固定 Python 版本能隔离系统环境避免污染其他项目git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 conda activate sadtalker再安装 PyTorch、ffmpeg 和 Python 依赖。CUDA 用户按 README.md 给出的 cu113 组合安装对应版本CPU 用户改装 PyTorch 的 CPU 版即可requirements.txt 里已涵盖 librosa、facexlib、gfpgan 等全部 Python 依赖pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113 conda install ffmpeg pip install -r requirements.txtmacOSM 系列芯片需额外执行pip install dlib否则会报 Illegal Hardware 错误。确认成功运行python -c import torch, librosa, gradio无报错。Step 3 一键下载模型文件模型不会随仓库分发但下载本身只有一条命令。Linux/macOS 直接运行官方脚本 scripts/download_models.shbash scripts/download_models.sh它会自动创建checkpoints/与gfpgan/weights/两个目录拉取映射网络mapping_*.pth.tar、256/512 两档渲染模型SadTalker_V0.0.2_*.safetensors以及 GFPGAN 人脸检测与增强权重。脚本用的是wget -nc已存在的文件会自动跳过断点重跑很安全。Windows 用户可参照 README.md 的 Download Models 章节中的网盘链接手动下载并按提示解压到相同位置。确认成功checkpoints/下有 2 个.safetensors和 2 个.pth.targfpgan/weights/下有 4 个.pth。运行时报unexpected EOF或文件找不到基本都是某个文件没下完整重跑脚本补齐即可。Step 4✅ 运行第一次音频驱动口型生成直接用仓库自带的示例素材验证全流程python inference.py --driven_audio examples/driven_audio/deyu.wav \ --source_image examples/source_image/happy.png \ --enhancer gfpgan产物保存在results/时间戳/下的 mp4 文件。--enhancer gfpgan会用人脸修复网络提升画质希望头部少动、保持原图姿态就加--still处理全身图再配合--preprocess full。选图建议正面、清晰、人脸占比合理的效果最好仓库examples/source_image/里有多张可参考。若不想敲命令Linux/mac 执行bash webui.sh、Windows 双击webui.bat可启动 WebUI更多参数参考视频借眨眼、自由视角等见 docs/best_practice.md。确认成功results/里出现新的 mp4播放时嘴型与语音对齐环境即打通。Step 5GPU 与 CPU 的参数取舍以及常见卡点运行环境建议参数说明GPU6GB 显存以上--size 512batch_size 保持默认分辨率更高速度可接受CPU--cpu --size 256 --batch_size 1速度慢但稳定适合学习和试用几个高频问题对应的处理方式显存不足CUDA out of memoryLinux 下先export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windows 用set仍不够就把--size降回 256、--batch_size降为 1。提示 ffmpeg 不是内部或外部命令ffmpeg 没装好或不在PATH里按 Step 1 补装。音频报错、Header missing输入只支持 wav 或 mp3其他格式先转码。M 系列 Mac 报 Illegal Hardware单独执行pip install dlib重装。更多细节可查 docs/FAQ.md。以上步骤全部走通后换用自己的照片和音频替换两条路径参数即可开始正式生成。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表