SadTalker从零到一:语音驱动会说话的人脸视频完整指南

发布时间:2026/9/15 14:38:10
SadTalker从零到一:语音驱动会说话的人脸视频完整指南 SadTalker从零到一语音驱动会说话的人脸视频完整指南【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker照着做完这一篇你就能用一张静态人像照片加一段音频生成一段口型、表情、头部动作都由语音驱动的说话头视频。全程不需要改任何一行代码建好环境、下好模型文件、敲一条命令就能看到成片 mp4。它凭什么值得你花时间 SadTalker 是 CVPR 2023 的工作核心公式很简单一张肖像图 一段音频 说话头视频。它内部用音频转表情模型算出每一帧该用什么表情用音频转姿态模型算出头部该怎么动再靠 3D 人脸模型逐帧渲染出来所以产出的是完整的人在说话而不只是嘴巴在动。和其他路线比一下你就知道它的位置对比项SadTalker口型修正类方案如 Wav2Lip云端 AI 视频服务输入要求单张人像 音频必须有一段原始视频图片/文本 音频生成范围表情 头部姿态整体动画只修嘴部区域说话头视频运行位置完全本地离线本地线上 API数据要上传适合谁想要可控、可复现、不联网出片的场景手里已有原视频不想折腾环境你手里只有一张图、又不想把素材传到别人的服务器上SadTalker 就是最顺手的选择。开始之前先自查四件事 ✅动手前花一分钟对照下面的清单能省掉后面大部分折腾系统Linux 体验最顺Windows 建议走 WSL 或装好 ffmpeg 的原生环境macOS 能跑但没有 GPU 加速主要当调试用显卡NVIDIA 显卡256 分辨率模型 4GB 显存起步8GB 以上跑 512 分辨率才从容没有独显可以加--cpu硬跑但会很慢Python官方流程基于 3.8直接用 conda 建同名版本的环境最稳磁盘代码 Python 依赖 模型文件预留 10GB 以上ffmpeg音视频编解码工具系统里必须有下面的环境步骤会顺手装好一条主线走通环境、依赖、模型文件 拉代码建一个隔离的 Python 环境git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 -y conda activate sadtalker为什么要隔离环境face_alignment、kornia 这类依赖的版本要求比较死和项目里其他 Python 包混装极易互相踩坏。装 PyTorch 和全部依赖pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113PyTorch 版本要和你的 CUDA 版本对应上面这条对应 CUDA 11.3换 CUDA 版本就去官方索引页选对应包。conda install ffmpeg pip install -r requirements.txtffmpeg 负责解码音频和编码输出视频requirements.txt里已经锁好了 audio 处理、人脸对齐、GFPGAN 增强等全部依赖不要手动增删版本冲突大多来自这里。下载模型文件bash scripts/download_models.sh这条脚本会把推理要用的渲染模型、映射网络以及 gfpgan 人脸增强权重一次性拉齐。它是断点友好的已经下完的文件会自动跳过网断了重跑一遍即可。具体包含哪些文件、每个文件干嘛看 scripts/download_models.sh 里的注释离线机器可以按那份清单从别处拷贝。如果不想折腾用 Docker 一步到位不想配环境的话社区镜像里依赖和模型都是现成的完整说明在 docs/install.mddocker run --gpus all --rm -v $(pwd):/host_dir wawa9000/sadtalker \ --driven_audio /host_dir/audio.wav \ --source_image /host_dir/image.jpg \ --still \ --result_dir /host_dir把音频和图片放进当前目录、改一下文件名就能出片。代价是容器里的模型版本和参数你动不了适合快速验证不适合改模型。看到效果最少参数的第一条出片命令 依赖和模型都就位后敲这条参数最少的命令python inference.py --driven_audio examples/driven_audio/chinese_news.wav --source_image examples/source_image/happy.png只需要音频和人像两个输入其余参数全部走默认值。跑起来你会看到控制台依次打印3DMM Extraction for source image从图片提取 3D 人脸参数、音频转系数、渲染三阶段的进度最后一行告诉你The generated video is named: results/xxxx.mp4。打开它画面里的人嘴型跟着中文新闻走头部有轻微自然的摆动这就是最基础的出片效果。下面这张就是项目自带的示例人像可以直接拿去当--source_image试常用参数速查 ⚙️真正决定出片质量的就是下面几个先记住推荐值其他以后慢慢玩参数默认值推荐值影响什么--enhancer gfpgan不启用gfpgan人脸增强清晰度明显提升代价是耗时变长--preprocesscrop大头特写用crop全身照用full输出是裁好的头部视频还是贴回原图尺寸的视频--still关全身照必开锁定头部姿态不晃适合full模式--size256显存小用256显存 ≥8GB 试512渲染分辨率直接影响显存占用--expression_scale1.00.7~1.2表情幅度嫌夸张就调低--batch_size2显存不足时改1出片速度 vs 显存的第一调节阀--ref_eyeblink无给一段真人短视频借用参考视频的眨眼眼神更自然各模式的对比效果图和更多取值说明都整理在 docs/best_practice.md。卡住了怎么办 ffmpeg is not recognized现象启动即报 ffmpeg 未识别原因ffmpeg 没装或者装了但不在 PATH 里处理Linux/macOS 跑conda install ffmpegmacOS 也可以brew install ffmpegWindows 确认 ffmpeg 可执行文件目录已加入 PATH然后重跑CUDA out of memory现象渲染阶段报RuntimeError: CUDA out of memory原因显存不够用 512 模型或高 batch 时尤其常见处理加--batch_size 1、把--size降回256还不行就在运行前设置export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128再启动报 No module named xxx 或文件损坏现象加载阶段抛 ModuleNotFoundError或提示unexpected EOF、文件损坏原因模型文件没下全或下载中断导致损坏处理对照 scripts/download_models.sh 检查checkpoints/下文件大小是否异常删掉坏文件后重跑下载脚本它会补齐缺失部分音频解码报错Invalid data found when processing input现象读音频时报 stream 解码错误原因音频格式不支持处理目前只吃 wav 和 mp3把其他格式先转成 wav 再传入口型和语音对不上现象播放视频时嘴比声音慢半拍或乱动原因头部晃动幅度过大造成观感错位或表情幅度没调好处理加--still压住头部动作再把--expression_scale调到0.8左右多数情况能对齐Cant get the coeffs of the input现象跑完直接打印这句并退出没有视频产出原因图片里的人脸没检测出来——图太小、角度太偏或是卡通/插画脸处理该模型目前只支持真实人物或接近真人的人像换一张正脸、脸部占比大的照片再试更多高频问题在 docs/FAQ.md 里排错前值得先翻一遍。接下来去哪 源码结构src/audio2exp_models/ 是音频转表情模块src/audio2pose_models/ 是音频转头部姿态模块src/facerender/ 是 3D 人脸渲染核心src/utils/ 放通用工具想改算法从这三处入手用法与进阶模式docs/best_practice.md含 reference 视频、自由视角等玩法安装疑难docs/install.md覆盖 macOS、WSL、Docker 等分支本地 WebUIpython app_sadtalker.py直接起网页版Stable Diffusion WebUI 插件的说明在 docs/webui_extension.md试玩素材examples/source_image/ 里几十张人像、examples/driven_audio/ 里中、日等多语言音频随便挑配对论文CVPR 2023 收录的《SadTalker: Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation》理解音频系数怎么驱动 3D 人脸看它你的下一步把两张素材换成自己的 ⌨️把命令里的示例音频和示例图片换成你自己的素材回车等它出片。第一个视频大概率不完美这是正常的——先调--still和expression_scale九成问题都在这两个参数里。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询