
数字人口播视频生成 Duix-Avatar本地部署到出片全流程实操指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一个可本地部署的开源数字人项目上传一段 10 秒左右的视频即可克隆你的形象和声音输入文案就能产出数字人口播视频。适合需要批量产出播报类视频的开发者与自媒体创作者。读完这篇你的本地环境能稳定产出第一个口播视频。 你准备用它做什么假设你有一条 30 秒的科普文案想让一个数字人替你念出来而且下次换文案还能复用同一个形象。输入一段 10 秒左右的真人出镜视频 → 服务端分离出静音视频和音频分别训练人脸模型和声音克隆 → 之后你只需要输入文本系统合成语音并驱动口型输出口播视频。整个过程数据不出本机形象、音色训练一次长期复用。相比传统 3D 数字人方案动辄数万元的制作成本这里一台配置够用的电脑加 Docker 就能跑。最低要求Windows 10 19042 或 Ubuntu 22.04 | 英伟达显卡驱动 | 32G 内存 | Docker | 推荐i5-13400F / RTX 4070 / 系统盘 100G 空闲 / 数据盘 30G 空闲 环境准备与安装这一步的目标是让三个后端服务跑起来加上客户端安装顺利的话四十分钟以内能搞定。检查显卡nvidia-smi能列出显卡型号和驱动版本就对了。这个项目所有算力都在本地没有英伟达显卡或驱动装不对后面的容器是起不来的。拉代码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar目录里能看到 README.md 和 deploy 文件夹就对了。准备环境Windows 用户先确认 WSL2 可用再用 Docker Desktop 安装包装 DockerUbuntu 22.04 直接sudo apt install docker.io docker-compose装好 Docker并按官方文档装好英伟达驱动和 NVIDIA Container Toolkit。wsl --list --verbose wsl --updateWSL 有版本号输出、Docker 桌面版能正常启动就对了。注意 Windows 的 compose 文件会把数据写到 D 盘D 盘至少留 30G 空闲。起服务在deploy目录下执行Ubuntu 换用 linux 版配置cd deploy docker-compose up -dcd deploy docker-compose -f docker-compose-linux.yml up -d首次拉镜像约 70G看网速要半小时左右。Docker 里出现 duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video 三个容器且状态都是 Running 就对了。装客户端Windows 安装官方构建的 .exe 安装包Ubuntu 下载 AppImage 直接启动root 用户需加--no-sandbox参数。客户端就是前面这些服务的图形化入口。客户端首次启动同意用户协议后进入主界面左侧是我的作品 / 我的数字模特上方两个入口分别对应做视频和定制模特 跑通第一个完整流程这一步从上传素材到拿到成片走完整条链路。先训练模特点创建数字人上传一段自拍视频。素材门槛不高但有硬要求时长至少 8 秒、分辨率 720P 以上、MP4/MOV 格式、全程只有一个人、五官清晰不遮挡、吐字清晰且在说话。名字填好提交定制等几分钟模型状态从训练中变为可用。再做第一个视频在我的数字模特里对这个模特点做视频进入编辑页。输入台词第一次建议控制在短句内比如大家好今天分享几个数字人本地部署的实用经验。音色选刚克隆出来的我的音色先点试听确认声音正常再点合成视频提交。提交后回到首页我的作品等状态变化从正在制作中到出片几分钟左右。生成完成后作品列表里会出现这条口播视频可以直接在线预览或下载 卡住了怎么办拉镜像超时报 request canceledDocker Hub 官方源连接不稳定。在 Docker 的 daemon.json 里加registry-mirrors配置国内镜像源然后重启 Docker 再拉。容器起来后立刻退出大概率是英伟达显卡或驱动的问题。先跑一遍nvidia-smi确认显卡可见、驱动正常再重启容器。新增模特时报错上传的视频里没有声音、或不是人在说话。声音克隆依赖这段音频程序拿不到有效人声就会失败重录一段正常说话的视频再传。合成或训练报 Connection refusedASR 服务启动比较慢服务刚拉起来就点训练容易撞上空窗内存偏小比如 16G也可能根本起不来。等几分钟再操作内存不够只能升配置。以上都没命中按 doc/常见问题.md 里的自查步骤走一遍再把客户端和服务端日志带上去项目 Issues 搜一下同款报错。 再往深走一步想接自己的系统模特训练、音频合成、视频合成都暴露了 HTTP 接口可参考 src/main/service/ 的调用方式显存紧张deploy/目录下的 lite 版 compose 只起视频合成单个服务用的是 50 系显卡改用 5090 专用 compose 文件启动详见 doc/常见问题.md跑通第一条视频之后剩下的就是调参数的事。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考