Duix.Avatar 数字人本地部署指南:10 秒视频克隆专属数字人与声音
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款开源数字人工具包,全程本地运行,提交一段 10 秒视频即可完成数字人形象与声音克隆,输入文案即可生成口播视频。本文跑通 Windows 与 Ubuntu 的完整部署流程。
项目速览
Duix.Avatar 是一款支持本地部署与 API 调用的数字人工具包。客户端是桌面应用,服务端由三个 Docker 容器承载,算力全部跑在你自己的机器上,素材不需要上传。
| 能力项 | 说明 | 适用场景 |
|---|---|---|
| 数字人形象克隆 | 提交 10 秒左右视频,训练出专属数字人模型 | 个人 IP、短视频固定出镜角色 |
| 声音克隆 | 从视频音轨中提取说话人音色,无需单独录音 | 个人配音、口播播报 |
| 文案生成视频 | 输入文本即生成口型匹配的播报视频 | 批量短视频制作 |
| 音频驱动 | 上传现成音频直接驱动数字人口型 | 已有录制的旁白素材 |
| 多语言支持 | 文案支持中、英、日、韩、法、德、阿、西 8 种语言 | 多语言内容产出 |
| 开放 API | 本地暴露端口,可接入自有系统 | 业务二次开发 |
环境准备与配置检查
部署前先确认机器满足两个硬性条件:NVIDIA 显卡且驱动装好、内存不低于 32GB。本项目所有算力都在本地,没有显卡,三个服务根本起不来。其余配置按下表对照:
| 项目 | 最低配置 | 推荐配置 |
|---|---|---|
| 系统 | Windows 10 19042.1526 或更高(Ubuntu 22.04 亦可) | 同左 |
| CPU | 近几代桌面 CPU | 13 代 Intel i5-13400F |
| 内存 | 32GB(必要) | 32GB 及以上 |
| 显卡 | 英伟达显卡 + 正确安装的驱动 | RTX 4070 |
| 磁盘 | 数据盘 >30GB;存镜像的盘 >100GB | 同左 + 稳定的 Wi-Fi 或网线 |
Windows 需要单独留一个 D 盘存放数字人和作品,C 盘存放 Docker 镜像文件。Ubuntu 只要求磁盘空闲空间大于 100GB。
三条命令自查环境:
nvidia-smi # 预期:右侧显示显卡型号与显存 wsl --list --verbose # Windows:预期显示发行版且 VERSION 为 2 free -h # Ubuntu:预期 Mem 总量 32GiB 以上部署实操
从一台空机器到第一条口播视频,大约一小时,其中大部分时间耗在拉取镜像上,实际操作只有几条命令。
配置 WSL 与 Docker(Windows)
先看上一条自查命令的输出,如果没有任何发行版,先安装(过程中会要求设置用户名和密码,记住它):
wsl --install # 安装 WSL,网络原因失败就多试几次 wsl --update # 更新 WSL 内核到最新版接着从 Docker 官网下载 Windows 版 Docker Desktop 安装包(按 CPU 架构选择),安装后启动,接受协议并跳过登录。
注意:C 盘剩余空间不足 100G 时,进入 Docker Desktop 的 Settings → Resources → Advanced,通过 "Disk image location" 把镜像盘换到剩余空间大于 100G 的磁盘,再 Apply & restart。
首次拉取约 70GB 镜像,速度慢或超时的话,进入 Settings → Docker Engine 添加 registry-mirrors 配置,再 Apply & restart:
Ubuntu 用户跳过本节,直接看本章末尾的方案。
一键拉起服务集群
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d # 首次拉取约 70GB 镜像,局域网环境约半小时三个服务各管一段流水线:
- duix-avatar-asr:语音识别,把训练音频转成文本(端口 10095)
- duix-avatar-tts:语音合成,把文本变成克隆音色的音频(端口 18180)
- duix-avatar-gen-video:视频合成,产出最终口播视频(端口 8383)
Windows 下作品与模型文件默认存放在D:\duix_avatar_data,这就是 D 盘要求 30GB 以上的原因。
成功标志:docker-compose ps中三个容器均为 Running 状态。
docker-compose ps # 预期:3 个服务全部 Running内存紧张可改用 lite 版,只保留视频合成服务:
docker-compose -f docker-compose-lite.yml up -d # 预期:仅 1 个服务 duix-avatar-gen-videoRTX 50 系列显卡使用专门的 compose(30/40 系列装了 CUDA 12.8 也可用它):
docker-compose -f docker-compose-5090.yml up -d # 预期:3 个服务全部 Running四份 compose 文件都在 deploy/ 目录,按硬件选一份即可。
安装并启动客户端
从官方发布页下载 Windows 版Duix.Avatar-x.x.x-setup.exe,双击安装并启动。首页会列出三个服务的连接状态,全部变绿即部署完成。
Ubuntu 下载 Linux 版,双击Duix.Avatar-x.x.x.AppImage即可启动,无需安装;root 桌面环境下需在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox。
Ubuntu 22.04 方案
sudo apt update sudo apt install -y docker.io docker-compose # 安装 Docker 与 docker-compose再按官方文档安装 NVIDIA 驱动(装完执行nvidia-smi应显示显卡信息),并按官方文档安装 nvidia-container-toolkit 让 Docker 能调用显卡,然后:
sudo nvidia-ctk runtime configure --runtime=docker sudo systemctl restart docker # 预期:重启后 docker --version 正常 cd deploy docker-compose -f docker-compose-linux.yml up -d # 预期:3 个服务全部 Running镜像下载慢时,在/etc/docker/daemon.json里加上 registry-mirrors 再重启 Docker。
功能实测
部署完成后,第一件事是用自己的 10 秒视频训练数字人。
创建数字人模特
入口:首页 → 蓝色 "Create Avatar" 卡片 → 上传视频。程序会把视频拆成静音视频 + 音频:画面用于形象,音频用于声音,一次完成两项克隆。
| 参数 | 建议值 | 说明 |
|---|---|---|
| 视频时长 | 10 秒左右 | 不必刻意加长 |
| 音频 | 必须包含人在说话 | 程序靠这段音频做声音克隆,无声视频不行 |
| 画面 | 人脸清晰、镜头稳定 | 降低训练失败概率 |
成功标志:模型出现在 My Avatars 列表中,带名称和时间戳。
注意:若报 "file not exists",先检查视频里有没有可提取的人声音轨。
生成口播视频
入口:首页 → "Create Video" 卡片 → 选择模特 → 输入文案或上传音频 → 等待合成。
| 参数 | 可选项 | 说明 |
|---|---|---|
| 输入方式 | 文本 | 输入文案,用克隆音色合成语音再对口型 |
| 输入方式 | 音频 | 上传现成旁白音频,直接驱动口型 |
| 文案语言 | 8 种 | 中、英、日、韩、法、德、阿拉伯、西班牙 |
| 模特 | 任一已训练模型 | 可随时切换 |
成功标志:My Works 中多出一条作品,可播放、可下载。
调用 API(可选)
Docker 启动后,服务在本地暴露端口,可以绕过客户端把数字人能力接进自己的系统。调用顺序:先模特训练,再音频合成,最后视频合成,前一步的返回值是后一步的入参。
| 接口 | 地址 | 用途 |
|---|---|---|
| 模特训练 | http://127.0.0.1:18180/v1/preprocess_and_tran | 预处理训练音频,返回参考音频及其文本 |
| 音频合成 | http://127.0.0.1:18180/v1/invoke | 文本 → 克隆音色音频 |
| 视频合成 | http://127.0.0.1:8383/easy/submit | 音频 + 模型 → 口型匹配视频 |
| 进度查询 | http://127.0.0.1:8383/easy/query | GET,code 取合成接口的唯一 key |
请求参数示例见 README_zh.md 的"开放 API"一节,客户端调用实现可参考 src/main/service/。
性能调优与进阶技巧
默认的 docker-compose.yml 面向 i5 + RTX 4070、32GB 内存这一档调优,其他档位的机器按下面这张表选:
| 配置项 | 推荐值 | 适用硬件档位 |
|---|---|---|
| 服务组合 | docker-compose-lite.yml,仅视频合成服务 | 内存或显存偏紧的机器 |
| 5090 专用 compose | docker-compose-5090.yml | RTX 50 系列;CUDA 12.8 的 30/40 系列也可用 |
| PYTORCH_CUDA_ALLOC_CONF | max_split_size_mb:512(已内置于配置) | 8G 显存档 |
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考