Duix.Avatar 数字分身从零跑通:三步本地部署完整指南
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款可以完全离线运行的数字分身工具:上传一段 10 秒左右的视频,克隆出形象与声音,之后只要输入文案,就能生成口型对齐的口播视频。适合想批量出培训视频的团队、不想每期出镜的口播创作者,以及需要把素材留在内网的用户。
跟着这篇文章走,从 clone 仓库到出第一条数字分身视频大约需要 1 小时,其中近半小时是镜像自动下载,不用盯着。
🧭 跑起来之前的两件事
先看配置门槛,所有算力都在本机完成,硬件要求如下:
| 项目 | 要求 |
|---|---|
| 系统 | Windows 10(19042.1526 及以上)或 Ubuntu 22.04 |
| 显卡 | NVIDIA 独显,驱动已装好(nvidia-smi能看到显卡) |
| 内存 | 16G 可用,推荐 32G |
| 磁盘 | 可用空间 100G 以上(镜像下载约 70G) |
| 软件 | Node.js 18、Docker(Windows 需 WSL 2) |
为什么值得自己搭一套?云端数字人服务按量计费,素材还要先上传;本地部署后,人脸视频、声音样本和成片全程不离开这台机器,断网也能继续出片,长期成本只有硬件本身。代价是前期要下载一次镜像,且必须有一张 NVIDIA 显卡。
🚀 跟着做,三步出第一个结果
第一步,把仓库拉到本地,里面既有客户端工程,也有服务端编排文件:
git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai你应看到:目录里能打开deploy/文件夹。
第二步,启动三个后端服务(语音识别、语音合成、视频合成),首次运行会自动拉取镜像:
cd deploy docker-compose up -d你应看到:Docker 中三个服务陆续变为Running;首次下载约 70G、耗时半小时左右。
客户端跑起来后就是这个主界面,先记住它的样子。
第三步,安装客户端依赖并启动桌面程序:
npm install npm run dev你应看到:弹出与上图一致的主界面,顶部有 Create Video 与 Create Avatar 两个入口,环境全部就绪。
🎬 拿它真正干点活:两个典型工作流
如果你要给多个部门各出一条培训视频,可以这样走:
- 输入:讲师本人 10 秒左右的口播视频,要求有清晰人声,再加一份课程文案。
- 操作:点 Create Avatar 完成一次形象与声音克隆;之后每更新一版课件,点 Create Video 粘贴新文案即可。
- 产出:口型自动对齐的口播视频,文案支持中、英、日、韩等 8 种语言,换新课程不用重拍讲师。
如果你要连续更口播内容、但每期都不想出镜:
- 输入:自己的一段自拍口播视频,全程只需要拍这一次。
- 操作:建模完成后每期只改文案,同一个模特反复使用;界面支持管理多个数字分身。
- 产出:同一张脸的系列视频,一次建模多次复用,省掉每次拍摄和剪辑的时间。
⚙️ 调一调,让它更顺手
- 内存:改什么——WSL 2 的内存上限(Docker Desktop → Settings → Resources → Advanced,或用户目录下的
.wslconfig文件)。为什么改——镜像下载与三个容器启动都很吃内存,给少了服务会起不来。改成多少——机器有 32G 内存时,给 WSL 分 16G 以上更稳。 - 存储:改什么——Docker 的磁盘镜像位置(同一设置页的 Disk image location)。为什么改——镜像加运行数据约 70G 起步,默认放 C 盘很容易塞满。改成多少——选一个剩余空间大于 100G 的盘。
- GPU:改什么——显卡驱动,Ubuntu 还需安装 NVIDIA Container Toolkit。为什么改——三个服务都依赖 nvidia 运行时,没有驱动直接起不来。改成多少——
nvidia-smi能正常显示显卡即达标;50 系列显卡请改用docker-compose-5090.yml启动。
以上参数的默认值都可以在 deploy/ 目录下的 docker-compose 文件中找到,改完记得重启容器生效。
🛠️ 卡住了?查这里
File not exists(新增模特时)→ 上传的视频里没有声音或没有人说话,程序取不到用于声音克隆的音频。
- 重录一段 10 秒左右、人声清晰的口播视频
- 确认 Docker 里三个服务都是 Running 再重试
Connection refused(克隆形象、训练时)→ ASR 服务启动较慢,或内存太小(如 16G)导致服务没起来。
- 服务全部 Running 后等几分钟再操作
- 内存吃紧时先用 lite 版
docker-compose-lite.yml,只跑视频合成服务
更多报错场景见 doc/常见问题.md。
⏩ 再进一步 + 下一步
跑通之后还有几个方向值得试:批量出片,用同一个模特反复生成不同文案的视频;声音克隆,换一段自己的语音样本做出专属音色;开放 API,模特训练、音频合成、视频合成都有本地接口,可以接进自己的脚本。
项目更新比较频繁,Ubuntu 桌面版和 NVIDIA 50 系列显卡方案都已支持,遇到问题先看最新版本说明。
现在打开终端,把仓库 clone 下来,第一条数字分身视频离你只差三条命令。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考