本地部署AI数字人:3步生成第一条口播视频
2026/9/11 6:18:04 网站建设 项目流程

本地部署AI数字人:3步生成第一条口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

在你自己的电脑上,一段 15 秒的自拍视频加一段文字,就能产出会说话、口型同步的 AI 数字人口播视频——这就是 Duix-Avatar 做的事。它是一个可本地部署的开源数字人创作平台,形象训练、声音克隆、视频合成全部离线完成,素材不用离开这台机器。

它能帮你做什么:口播视频的三个落地场景

  • 自媒体日更口播:真人出镜一天拍一条已经吃力,数字人版本里你只需改台词。相比数万元起步的 3D 数字人制作,它免费开源、个人零成本,全程图形界面不用写代码。
  • 课程与知识付费录课:讲师的声音会被克隆进模型,成片保留你的音色和语气。课程更新只换文字脚本,不用重录;脚本支持中、英、日、韩等 8 种语言。
  • 企业宣传与内部培训:产品发布、合规培训、门店宣传,批量产出边际成本接近于零;流程全程在内网机器离线跑,人脸和声音样本不外传。有开发能力时,开放接口还能把它接进自有系统做二次开发。

开工前,先确认你的机器:Duix-Avatar 硬件要求

算力全部在本地,硬件是硬门槛:

项目要求
显卡英伟达独显且驱动可用(nvidia-smi能显示显卡),推荐 RTX 4070 及以上
内存32GB 起步,16GB 大概率带不动
磁盘Windows:C 盘 100GB 放服务镜像,D 盘 30GB 放项目数据;Ubuntu:预留 100GB 以上
系统Windows 10 19042.1526 及以上,或 Ubuntu 22.04
CPU推荐 i5-13400F 或同级

系统侧各做一步准备:

  • Windowswsl --list --verbose有输出说明 WSL2 已装,再执行wsl --update,然后装好 Docker Desktop。
  • Ubuntu 22.04docker --version能打印版本即可;另需英伟达驱动和 NVIDIA Container Toolkit,装完用nvidia-smi验证。

不达标怎么办:配置紧一点,可以先跑精简版docker-compose -f docker-compose-lite.yml up -d,只起视频合成一个服务;完全没有英伟达显卡就别硬上,三个服务都依赖 GPU 调度——换一台达标的机器,或者干脆用云端 GPU 跑。

Duix-Avatar 部署步骤:把服务跑起来的最小路径

Step 1 拿到项目代码

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

✅ 完成信号:目录下能看到README.mdpackage.jsondeploy/里有docker-compose.yml

Step 2 启动服务容器

cd deploy docker-compose up -d

Ubuntu 换成docker-compose -f docker-compose-linux.yml up -d。首次拉镜像约 70GB,视网速等 20–30 分钟。

✅ 完成信号:容器列表出现duix-avatar-ttsduix-avatar-asrduix-avatar-gen-video,STATUS 均为 Running。

Step 3 安装客户端

到项目 Releases 页下载官方安装包:Windows 双击.exe安装,Ubuntu 直接运行.AppImage(root 用户需加--no-sandbox)。客户端只是前台,真正训练和合成靠的是后厨那三个容器。

✅ 完成信号:首次启动弹出用户协议,同意后能看到 "Create Video" 和 "Create Avatar" 两个入口。

产出你的第一条数字人视频:从素材训练到口播成片

准备素材:录一段 10–15 秒的正面说话视频,光线足、面部无阴影、背景简单、声音干净。必须包含你本人在说话——这段声音会被拿去克隆音色,静音素材会直接报错。

训练形象:点 "Create Avatar",上传视频、给模型起名,5–10 分钟进度条走完。

写台词:在 My Avatars 选中刚训好的模型,点 "Create Video" 输入脚本,第一次建议 50 字以内。

调语音参数:语速分慢速/正常/快速,语调分平缓与抑扬顿挫,情感可微调。

生成:点生成,等 3–5 分钟,播一遍确认口型与语音无明显错位。

批量生成:直接调本地 API

服务起来后,Duix-Avatar 把语音合成和视频合成都暴露在本地端口:TTS 是http://127.0.0.1:18180/v1/invoke,视频合成是http://127.0.0.1:8383/easy/submit(参数与用法见 README 的 API 章节)。批量跑就是循环提交再轮询进度:

curl -X POST http://127.0.0.1:8383/easy/submit \ -H "Content-Type: application/json" \ -d '{"audio_url":"...wav","video_url":"...mp4","code":"<uuid>","chaofen":0,"watermark_switch":0,"pn":1}'

进度用GET http://127.0.0.1:8383/easy/query?code=<uuid>查,code是提交时自己填的唯一键。

卡住了看这里:Duix-Avatar 部署与训练排错

现象原因处理
三个服务起不来、反复重启无英伟达显卡或驱动失效nvidia-smi验证,升级 NVIDIA 驱动后重启容器
docker-compose up报 registry-1.docker.io 连接失败Docker Hub 直连不稳在 Docker Desktop 的 Docker Engine 配置镜像加速源,参考官方常见问题
训练报 "file does not exist"素材没落到约定数据目录检查 D 盘duix_avatar_data映射,确认上传的是带人声的说话视频
训练报 ASR Connection refusedfun-asr 启动慢,16GB 内存可能带不动服务端起来后等几分钟再训练;内存不足就升级
端口 18180/8383/10095 冲突本机其他程序占用查杀占用进程,或改deploy/docker-compose.yml端口映射
数字人视频口型不同步素材质量差或 GPU 未参与计算重拍光线均匀、头部稳定的素材,nvidia-smi确认容器吃到显存

跑通一遍,本地部署约半小时,第一条数字人口播视频一小时内出片。下一步的自然延伸是打开src/main/service/,把训练、语音、合成三个接口包进自己的脚本或系统里,做批量化和自动化。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询