
30分钟跑通SadTalker部署单张图加一段音频生成会说话的头像视频无显卡也能跑【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 部署的最终形态很简单你给它一张人像照片和一段 wav 音频它还你一个 mp4——照片里的人开口说话口型跟着音频走头部有轻微摆动全身图像也能动起来。整个过程完全离线不上传任何数据。先看效果跑起来后你得到什么一张照片 一段音频图就开始说话下面的动图来自仓库自带的示例输入一张全身图 一段语音输出全身几乎不动、只有脸在说话的视频加了 GFPGAN 人脸增强。输入材料长这样照片不必专业正面人像、全身照、甚至偏插画风的图片都支持。仓库里预置了一堆示例直接拿来练手就行音频方面examples/driven_audio/下有十几个中英文 wav从新闻到诗歌都有任选一个就能出片。完成标志你能在仓库里找到一张人脸清晰的图和一段 wav并且知道上面那张动图就是最终目标。SadTalker 是做什么的定位音频驱动的说话人脸动画这是腾讯 AI Lab 的 CVPR 2023 论文开源。原理一句话先把音频转成脸部运动指令3D 运动系数再让照片里的脸按指令动最后逐帧渲染成视频。你不需要懂这些只需要知道它对人脸结构的依赖很强。适合谁用想做口播、角色配音、数字人素材手里只有一张正脸照做 talking head 方向研究想复现或魔改模型给已有 WebUI如 SD WebUI 插件加说话人功能的开发者不适合谁用二次元、Q 版、非写实画风官方明确说模型只对真人或写实人像有效想编辑一段已有视频的口型那是另一个需求本项目是图音频→新视频对身份复刻精度有合规敏感场景生成他人 likeness 请谨慎后文会再提醒完成标志你确认自己的素材是写实人像且需求是生成而不是改已有视频。开跑前10秒检查硬件与软件要求项目最低推荐系统Windows 10 / macOS / Ubuntu 20.04Win11 / Ubuntu 22.04Python3.8 ~ 3.103.8脚本默认环境内存8GB16GB磁盘10GB 空闲模型依赖20GB SSD显卡不需要CPU 可跑慢NVIDIA4GB 显存FFmpeg必需必需 没有独显也能跑只是生成速度慢几倍下文 FAQ 有 CPU 相关设置。确认 GPU 状态可选环境装好后在项目根目录执行一条命令自检python -c import torch; print(torch.cuda.is_available())输出True就自动走 GPUFalse也正常程序会自动落到 CPU或显式加--cpu参数。模型文件放哪生成前必须把权重下好最终结构应包含文件/目录作用checkpoints/SadTalker_V0.0.2_256.safetensors256 分辨率人脸渲染主模型checkpoints/SadTalker_V0.0.2_512.safetensors512 分辨率人脸渲染主模型checkpoints/mapping_00109-model.pth.tar、mapping_00229-model.pth.tar音频到系数的 MappingNetgfpgan/weights/4 个 .pth人脸检测 GFPGAN 增强完成标志机器满足最低行、checkpoints/与gfpgan/目录已就位或知道马上要下载。最短路径跑通Windows 一键安装Windows 一键本地安装装好 Python 3.8安装时勾选 Add Python to PATH和 Git装 ffmpeg最省事的是用 Scoop 一行命令scoop install ffmpeg克隆仓库git clone https://gitcode.com/GitHub_Trending/sa/SadTalker然后进目录双击webui.bat。它会自动建 venv、装依赖、拉起 WebUI你不用手动敲任何 pip 命令。这就是一键启动的全部。macOS / Linux 差异点不重复全流程只列差异用 conda 建 3.8 环境conda create -n sadtalker python3.8激活后执行pip install -r requirements.txtffmpeg 用conda install ffmpeg装macOS 额外单独执行pip install dlib否则 M 系列芯片会崩见 FAQ启动用bash webui.sh脚本同样自动建 venv 并装依赖。各平台细节见 docs/install.md。 下载模型文件Linux/macOS 直接跑官方脚本自动建目录并下载全部权重含 gfpganbash scripts/download_models.shWindows 下该脚本不可用按仓库 READMEDownload Models小节列出的网盘/网盘镜像源手动下载解压后放进checkpoints/和gfpgan/weights/文件名必须与上一节表格一致。完成标志浏览器自动打开 127.0.0.1:7860页面出现图片/音频上传框和 Generate 按钮。生成你的第一个视频WebUI 路线推荐先走这条打开 127.0.0.1:7860 后左侧上传人像图仓库自带示例examples/source_image/full_body_2.png中间上传音频或非 Windows 环境直接输入文字由内置 TTS 生成语音Settings 里选preprocess默认crop、勾选 Still Mode 和 GFPGAN 增强、分辨率选 256点 Generate右侧直接播放结果 命令行路线同一条最短命令跑在激活了依赖的终端里python inference.py --driven_audio examples/driven_audio/deyu.wav --source_image examples/source_image/full_body_2.png --preprocess full --still输出在results/时间戳.mp4。完整参数表在 inference.py 里常用调选项见 docs/best_practice.md。参数模式速查表你想要的效果关键参数说明标准头像动画--preprocess crop默认只动画人脸区域头动最自然全身不动、只说话--preprocess full --still全身照首选头姿保持原图人脸更清晰--enhancer gfpgan耗时增加画质提升明显表情更足/更收--expression_scale 1.5/0.5默认 1.0无显卡跑--cpu速度换可用更高清脸--size 512显存要求约翻倍完成标志results/下出现一个 mp4播放时口型与音频对齐、背景无大面积撕裂。换一种姿势运行Docker 一条命令启动Docker 单命令社区镜像wawa9000/sadtalker已封装好环境一条命令出片把$(pwd)指向放素材的目录docker run --gpus all -v $(pwd):/host_dir wawa9000/sadtalker --driven_audio /host_dir/deyu.wav --source_image /host_dir/image.jpg --still一句话说明容器内自动处理依赖和模型结果直接写回你挂载的本地目录适合不想污染本机的场景。完全不想装环境在线 demoColab 和 HF Spaces 上都有社区部署的 SadTalker 在线实例搜项目名即可找到打开浏览器传文件即用官方还把它接进了 Discord发图音频就能出视频。适合先尝鲜、再决定要不要本地部署。完成标志容器日志滚完并输出结果路径或在线页面给出视频。卡住了看这里按报错关键词找修复ffmpeg is not recognized/ ffmpeg not found现象启动或生成时报 ffmpeg 找不到原因没装 ffmpeg或装了但不在 PATH一步修复Windows 用scoop install ffmpegLinux 用conda install ffmpegMac 用 brew装完新开终端再试CUDA out of memory现象生成中途报显存不足原因显存不够或碎片化常见于 4GB 小显存一步修复跑命令前设置环境变量PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windows 用setLinux 用export或把--size降到 256、--batch_size降到 1No module named ai/ 加载模型报错现象No module named ai、unexpected EOF、No such file or directory: checkpoints\...这类原因模型文件没下全、下坏了或目录结构放错一步修复删掉可疑文件重跑bash scripts/download_models.sh按仓库 README 核对checkpoints/结构音频报错 / Mac M1 崩溃现象Error while decoding stream或 Mac M 系列Illegal hardware error原因前者只支持 wav/mp3 两种音频格式后者是 dlib 预编译包与芯片不兼容一步修复把音频转成 wav 再喂进去Mac 上单独执行pip install dlib重装完成标志报错消失进程进入 3DMM Extraction 或渲染阶段。更快更好三个调优点省显存、提速动分辨率和批大小改命令参数--size 256默认值、--batch_size 1默认 2。预期收益显存占用下降、吞吐更稳追求画质时再换回 512。⚡ 更清晰的脸增强开关加--enhancer gfpgan人脸修复全身再糊时可加--background_enhancer realesrgan整段视频超分。预期收益五官细节明显变好代价是生成时间增加长音频建议先小样验证。更自然的动表情与头姿--expression_scale在 0.5~1.5 之间调强弱嫌头部乱晃就加--still锁住头姿想让眨眼/头姿更像真人可用--ref_eyeblink、--ref_pose指一段参考视频借动作。批量出片用 src/generate_batch.py 遍历目录。完成标志同一段素材调参后的成品在清晰度、动作幅度上有一项肉眼可见的改善。收尾资源与提醒继续挖的材料各平台安装细节docs/install.md参数最佳实践docs/best_practice.md官方 FAQdocs/FAQ.md3D 人脸可视化扩展docs/face3d.md更新记录docs/changlelog.md用途提醒本项目以研究与学习为目的生成他人肖像前先取得本人同意发布内容遵守当地法规与平台规则代码完全离线运行不涉及数据上传但你自己搭服务时请自行做好合规与隐私措施。完成标志你已经能独立复现图音频→视频并知道每个参数卡住时去哪篇文档查。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考