ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

SadTalker完整教程:一张照片加一段音频,本地免费跑出数字人视频

SadTalker完整教程:一张照片加一段音频,本地免费跑出数字人视频 SadTalker完整教程一张照片加一段音频本地免费跑出数字人视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是 CVPR 2023 的开源项目。给它一张人物照片和一段音频它会输出口型、头部摆动、眨眼都跟着音频走的说话头视频。做虚拟主播、数字代言人口播都能用全程在你自己的电脑上跑免费。先看效果SadTalker 能生成什么样的数字人视频成品视频由音频驱动嘴型跟语音对齐头会轻微转动眨眼时机自然。半身人像可以动起来全身照也行人物风格覆盖真人照片和写实插画。动作偏大偏小、画面偏糊后面都有对应参数。全文顺序是备素材 → 跑出第一条视频 → 三个拉高画质的旋钮。动手之前先把源图和驱动音频备齐源图按这 4 条挑面部正面、清晰不被手或物体遮挡光照均匀别过暗或强逆光短边不低于 512 像素真人照片、写实风插画最稳。官方说明里写明动漫风插画暂不支持全身照同样能处理构图参考这张驱动音频的要求很简单WAV 格式人声清楚、杂音少时长在 5 到 60 秒之间效果较好没有素材也没关系仓库自带示例示例图片examples/source_image/示例音频中文、英文、日文都有examples/driven_audio/示例参考视频examples/ref_video/最小运行路径克隆仓库、装依赖、跑出第一条视频第一步克隆仓库并进入目录git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker第二步安装依赖pip install -r requirements.txt第三步把模型文件下到 checkpoints 目录。Linux 和 macOS 用自带脚本Windows 按 README 里的下载地址手动下bash scripts/download_models.sh第四步用示例素材跑第一条视频python inference.py --driven_audio examples/driven_audio/chinese_news.wav --source_image examples/source_image/art_0.png跑完后到results/目录找带时间戳的子文件夹里面的 mp4 就是成品。环境装不上或报错时先看对应平台的 docs/install.md。三个最能拉高画质的旋钮参考视频、面部增强、输入风格旋钮 1加参考视频动作更自然。用--ref_pose和--ref_eyeblink各传一段视频SadTalker 会借用视频里的头部姿态和眨眼节奏成品不像在镜头前站着不动。仓库里的示例视频可以直接拿来试python inference.py --driven_audio examples/driven_audio/chinese_news.wav --source_image examples/source_image/art_0.png --ref_pose examples/ref_video/WDA_AlexandriaOcasioCortez_000.mp4 --ref_eyeblink examples/ref_video/WDA_AlexandriaOcasioCortez_000.mp4旋钮 2面部增强细节更实。加--enhancer gfpgan可以修复面部纹理换RestoreFormer是另一种风格想要整帧更清晰再追加--background_enhancer realesrgan。旋钮 3输入风格匹配场景。真人照片口型最稳写实插画也能驱动。全身照建议用--still配合--preprocess full头部动作更收敛适合口播类素材。表情嫌僵硬时调大--expression_scale就能让动作更明显。卡住了翻这两个文档docs/FAQ.mdffmpeg 缺失、模型文件不完整、Mac M1 环境、CUDA 显存不足这些常见报错都有对应处理办法docs/best_practice.md官方参数对照表写清了各模式什么时候用、效果差别在哪把你自己的照片和音频填进上面的命令跑一遍。几分钟后第一条数字人视频就在results/目录里。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表