Duix.Avatar 数字人本地部署指南:10 秒视频克隆专属数字人与声音
2026/9/11 3:52:18 网站建设 项目流程

Duix.Avatar 数字人本地部署指南:10 秒视频克隆专属数字人与声音

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款开源数字人工具包,全程本地运行,提交一段 10 秒视频即可完成数字人形象与声音克隆,输入文案即可生成口播视频。本文跑通 Windows 与 Ubuntu 的完整部署流程。

项目速览

Duix.Avatar 是一款支持本地部署与 API 调用的数字人工具包。客户端是桌面应用,服务端由三个 Docker 容器承载,算力全部跑在你自己的机器上,素材不需要上传。

能力项说明适用场景
数字人形象克隆提交 10 秒左右视频,训练出专属数字人模型个人 IP、短视频固定出镜角色
声音克隆从视频音轨中提取说话人音色,无需单独录音个人配音、口播播报
文案生成视频输入文本即生成口型匹配的播报视频批量短视频制作
音频驱动上传现成音频直接驱动数字人口型已有录制的旁白素材
多语言支持文案支持中、英、日、韩、法、德、阿、西 8 种语言多语言内容产出
开放 API本地暴露端口,可接入自有系统业务二次开发

环境准备与配置检查

部署前先确认机器满足两个硬性条件:NVIDIA 显卡且驱动装好、内存不低于 32GB。本项目所有算力都在本地,没有显卡,三个服务根本起不来。其余配置按下表对照:

项目最低配置推荐配置
系统Windows 10 19042.1526 或更高(Ubuntu 22.04 亦可)同左
CPU近几代桌面 CPU13 代 Intel i5-13400F
内存32GB(必要)32GB 及以上
显卡英伟达显卡 + 正确安装的驱动RTX 4070
磁盘数据盘 >30GB;存镜像的盘 >100GB同左 + 稳定的 Wi-Fi 或网线

Windows 需要单独留一个 D 盘存放数字人和作品,C 盘存放 Docker 镜像文件。Ubuntu 只要求磁盘空闲空间大于 100GB。

三条命令自查环境:

nvidia-smi # 预期:右侧显示显卡型号与显存 wsl --list --verbose # Windows:预期显示发行版且 VERSION 为 2 free -h # Ubuntu:预期 Mem 总量 32GiB 以上

部署实操

从一台空机器到第一条口播视频,大约一小时,其中大部分时间耗在拉取镜像上,实际操作只有几条命令。

配置 WSL 与 Docker(Windows)

先看上一条自查命令的输出,如果没有任何发行版,先安装(过程中会要求设置用户名和密码,记住它):

wsl --install # 安装 WSL,网络原因失败就多试几次 wsl --update # 更新 WSL 内核到最新版

接着从 Docker 官网下载 Windows 版 Docker Desktop 安装包(按 CPU 架构选择),安装后启动,接受协议并跳过登录。

注意:C 盘剩余空间不足 100G 时,进入 Docker Desktop 的 Settings → Resources → Advanced,通过 "Disk image location" 把镜像盘换到剩余空间大于 100G 的磁盘,再 Apply & restart。

首次拉取约 70GB 镜像,速度慢或超时的话,进入 Settings → Docker Engine 添加 registry-mirrors 配置,再 Apply & restart:

Ubuntu 用户跳过本节,直接看本章末尾的方案。

一键拉起服务集群

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d # 首次拉取约 70GB 镜像,局域网环境约半小时

三个服务各管一段流水线:

  • duix-avatar-asr:语音识别,把训练音频转成文本(端口 10095)
  • duix-avatar-tts:语音合成,把文本变成克隆音色的音频(端口 18180)
  • duix-avatar-gen-video:视频合成,产出最终口播视频(端口 8383)

Windows 下作品与模型文件默认存放在D:\duix_avatar_data,这就是 D 盘要求 30GB 以上的原因。

成功标志docker-compose ps中三个容器均为 Running 状态。

docker-compose ps # 预期:3 个服务全部 Running

内存紧张可改用 lite 版,只保留视频合成服务:

docker-compose -f docker-compose-lite.yml up -d # 预期:仅 1 个服务 duix-avatar-gen-video

RTX 50 系列显卡使用专门的 compose(30/40 系列装了 CUDA 12.8 也可用它):

docker-compose -f docker-compose-5090.yml up -d # 预期:3 个服务全部 Running

四份 compose 文件都在 deploy/ 目录,按硬件选一份即可。

安装并启动客户端

从官方发布页下载 Windows 版Duix.Avatar-x.x.x-setup.exe,双击安装并启动。首页会列出三个服务的连接状态,全部变绿即部署完成。

Ubuntu 下载 Linux 版,双击Duix.Avatar-x.x.x.AppImage即可启动,无需安装;root 桌面环境下需在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox

Ubuntu 22.04 方案

sudo apt update sudo apt install -y docker.io docker-compose # 安装 Docker 与 docker-compose

再按官方文档安装 NVIDIA 驱动(装完执行nvidia-smi应显示显卡信息),并按官方文档安装 nvidia-container-toolkit 让 Docker 能调用显卡,然后:

sudo nvidia-ctk runtime configure --runtime=docker sudo systemctl restart docker # 预期:重启后 docker --version 正常 cd deploy docker-compose -f docker-compose-linux.yml up -d # 预期:3 个服务全部 Running

镜像下载慢时,在/etc/docker/daemon.json里加上 registry-mirrors 再重启 Docker。

功能实测

部署完成后,第一件事是用自己的 10 秒视频训练数字人。

创建数字人模特

入口:首页 → 蓝色 "Create Avatar" 卡片 → 上传视频。程序会把视频拆成静音视频 + 音频:画面用于形象,音频用于声音,一次完成两项克隆。

参数建议值说明
视频时长10 秒左右不必刻意加长
音频必须包含人在说话程序靠这段音频做声音克隆,无声视频不行
画面人脸清晰、镜头稳定降低训练失败概率

成功标志:模型出现在 My Avatars 列表中,带名称和时间戳。

注意:若报 "file not exists",先检查视频里有没有可提取的人声音轨。

生成口播视频

入口:首页 → "Create Video" 卡片 → 选择模特 → 输入文案或上传音频 → 等待合成。

参数可选项说明
输入方式文本输入文案,用克隆音色合成语音再对口型
输入方式音频上传现成旁白音频,直接驱动口型
文案语言8 种中、英、日、韩、法、德、阿拉伯、西班牙
模特任一已训练模型可随时切换

成功标志:My Works 中多出一条作品,可播放、可下载。

调用 API(可选)

Docker 启动后,服务在本地暴露端口,可以绕过客户端把数字人能力接进自己的系统。调用顺序:先模特训练,再音频合成,最后视频合成,前一步的返回值是后一步的入参。

接口地址用途
模特训练http://127.0.0.1:18180/v1/preprocess_and_tran预处理训练音频,返回参考音频及其文本
音频合成http://127.0.0.1:18180/v1/invoke文本 → 克隆音色音频
视频合成http://127.0.0.1:8383/easy/submit音频 + 模型 → 口型匹配视频
进度查询http://127.0.0.1:8383/easy/queryGET,code 取合成接口的唯一 key

请求参数示例见 README_zh.md 的"开放 API"一节,客户端调用实现可参考 src/main/service/。

性能调优与进阶技巧

默认的 docker-compose.yml 面向 i5 + RTX 4070、32GB 内存这一档调优,其他档位的机器按下面这张表选:

配置项推荐值适用硬件档位
服务组合docker-compose-lite.yml,仅视频合成服务内存或显存偏紧的机器
5090 专用 composedocker-compose-5090.ymlRTX 50 系列;CUDA 12.8 的 30/40 系列也可用
PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:512(已内置于配置)8G 显存档

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询