本地部署AI数字人:3步生成第一条口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
在你自己的电脑上,一段 15 秒的自拍视频加一段文字,就能产出会说话、口型同步的 AI 数字人口播视频——这就是 Duix-Avatar 做的事。它是一个可本地部署的开源数字人创作平台,形象训练、声音克隆、视频合成全部离线完成,素材不用离开这台机器。
它能帮你做什么:口播视频的三个落地场景
- 自媒体日更口播:真人出镜一天拍一条已经吃力,数字人版本里你只需改台词。相比数万元起步的 3D 数字人制作,它免费开源、个人零成本,全程图形界面不用写代码。
- 课程与知识付费录课:讲师的声音会被克隆进模型,成片保留你的音色和语气。课程更新只换文字脚本,不用重录;脚本支持中、英、日、韩等 8 种语言。
- 企业宣传与内部培训:产品发布、合规培训、门店宣传,批量产出边际成本接近于零;流程全程在内网机器离线跑,人脸和声音样本不外传。有开发能力时,开放接口还能把它接进自有系统做二次开发。
开工前,先确认你的机器:Duix-Avatar 硬件要求
算力全部在本地,硬件是硬门槛:
| 项目 | 要求 |
|---|---|
| 显卡 | 英伟达独显且驱动可用(nvidia-smi能显示显卡),推荐 RTX 4070 及以上 |
| 内存 | 32GB 起步,16GB 大概率带不动 |
| 磁盘 | Windows:C 盘 100GB 放服务镜像,D 盘 30GB 放项目数据;Ubuntu:预留 100GB 以上 |
| 系统 | Windows 10 19042.1526 及以上,或 Ubuntu 22.04 |
| CPU | 推荐 i5-13400F 或同级 |
系统侧各做一步准备:
- Windows:
wsl --list --verbose有输出说明 WSL2 已装,再执行wsl --update,然后装好 Docker Desktop。 - Ubuntu 22.04:
docker --version能打印版本即可;另需英伟达驱动和 NVIDIA Container Toolkit,装完用nvidia-smi验证。
不达标怎么办:配置紧一点,可以先跑精简版docker-compose -f docker-compose-lite.yml up -d,只起视频合成一个服务;完全没有英伟达显卡就别硬上,三个服务都依赖 GPU 调度——换一台达标的机器,或者干脆用云端 GPU 跑。
Duix-Avatar 部署步骤:把服务跑起来的最小路径
Step 1 拿到项目代码
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar✅ 完成信号:目录下能看到README.md、package.json,deploy/里有docker-compose.yml。
Step 2 启动服务容器
cd deploy docker-compose up -dUbuntu 换成docker-compose -f docker-compose-linux.yml up -d。首次拉镜像约 70GB,视网速等 20–30 分钟。
✅ 完成信号:容器列表出现duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video,STATUS 均为 Running。
Step 3 安装客户端
到项目 Releases 页下载官方安装包:Windows 双击.exe安装,Ubuntu 直接运行.AppImage(root 用户需加--no-sandbox)。客户端只是前台,真正训练和合成靠的是后厨那三个容器。
✅ 完成信号:首次启动弹出用户协议,同意后能看到 "Create Video" 和 "Create Avatar" 两个入口。
产出你的第一条数字人视频:从素材训练到口播成片
准备素材:录一段 10–15 秒的正面说话视频,光线足、面部无阴影、背景简单、声音干净。必须包含你本人在说话——这段声音会被拿去克隆音色,静音素材会直接报错。
训练形象:点 "Create Avatar",上传视频、给模型起名,5–10 分钟进度条走完。
写台词:在 My Avatars 选中刚训好的模型,点 "Create Video" 输入脚本,第一次建议 50 字以内。
调语音参数:语速分慢速/正常/快速,语调分平缓与抑扬顿挫,情感可微调。
生成:点生成,等 3–5 分钟,播一遍确认口型与语音无明显错位。
批量生成:直接调本地 API
服务起来后,Duix-Avatar 把语音合成和视频合成都暴露在本地端口:TTS 是http://127.0.0.1:18180/v1/invoke,视频合成是http://127.0.0.1:8383/easy/submit(参数与用法见 README 的 API 章节)。批量跑就是循环提交再轮询进度:
curl -X POST http://127.0.0.1:8383/easy/submit \ -H "Content-Type: application/json" \ -d '{"audio_url":"...wav","video_url":"...mp4","code":"<uuid>","chaofen":0,"watermark_switch":0,"pn":1}'进度用GET http://127.0.0.1:8383/easy/query?code=<uuid>查,code是提交时自己填的唯一键。
卡住了看这里:Duix-Avatar 部署与训练排错
| 现象 | 原因 | 处理 |
|---|---|---|
| 三个服务起不来、反复重启 | 无英伟达显卡或驱动失效 | 用nvidia-smi验证,升级 NVIDIA 驱动后重启容器 |
docker-compose up报 registry-1.docker.io 连接失败 | Docker Hub 直连不稳 | 在 Docker Desktop 的 Docker Engine 配置镜像加速源,参考官方常见问题 |
| 训练报 "file does not exist" | 素材没落到约定数据目录 | 检查 D 盘duix_avatar_data映射,确认上传的是带人声的说话视频 |
| 训练报 ASR Connection refused | fun-asr 启动慢,16GB 内存可能带不动 | 服务端起来后等几分钟再训练;内存不足就升级 |
| 端口 18180/8383/10095 冲突 | 本机其他程序占用 | 查杀占用进程,或改deploy/docker-compose.yml端口映射 |
| 数字人视频口型不同步 | 素材质量差或 GPU 未参与计算 | 重拍光线均匀、头部稳定的素材,nvidia-smi确认容器吃到显存 |
跑通一遍,本地部署约半小时,第一条数字人口播视频一小时内出片。下一步的自然延伸是打开src/main/service/,把训练、语音、合成三个接口包进自己的脚本或系统里,做批量化和自动化。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考