从10秒视频到数字分身:Duix.Avatar本地部署的完整路径
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一个完全开源的数字人工具包:你上传一段 10 秒左右的视频,它就能克隆你的形象和声音,之后输入文案或音频,本地即可生成口播视频。全程离线,不需要把影像资料传到任何服务器。下面按"先体检、再部署、会排障、能二开"的顺序,把我跑通这套流程的关键判断都写出来,你照着走就能在自己电脑上跑起来。
跑之前先认识它的三个服务
装之前值得花一分钟搞懂它由什么组成,后面排障会省事很多。
- 整个服务端是三个 Docker 容器,都在本地占用 NVIDIA 显卡算力:
duix-avatar-asr(语音识别,基于 FunASR)、duix-avatar-tts(声音克隆,基于 fish-speech)、duix-avatar-gen-video(口型与视频合成)。端口分别是 10095、18180、8383,定义在 deploy/docker-compose.yml 里。 - 客户端是 Electron + Vue 写的桌面应用,负责上传素材、管理数字人和作品,数据存在本地 SQLite,视频处理交给 src/main/util/ffmpeg.js。
- 数据流是"说话视频 → 拆出画面和声音 → 分别训练 → 新文案驱动口型",首尾都在你本机完成,这是它全离线能力的来源。
显卡、驱动、硬盘:三道必答题
必须是一张 NVIDIA 显卡,且驱动装好了。这一点没有商量余地——官方文档原话是:本项目所有算力都在本地,没有英伟达显卡或没有驱动程序,三个服务是启动不了的。推荐配置是 13 代 i5-13400F、32GB 内存(文档标注为必要项)、RTX 4070;16GB 内存的机器则可能起不来 ASR 服务,后面排障一节还会提到。
装完驱动后在终端敲一下nvidia-smi,能看到显卡型号和驱动版本就说明显卡这道题通过了。
硬盘方面,首次部署要下载约 70GB 的镜像流量,所以空间要提前留足:
| 检查项 | Windows | Ubuntu 22.04 |
|---|---|---|
| 系统版本 | Win10 19042.1526 或更高 | 官方完成适配验证的是 22.04 Desktop(内核 6.8.0-52-generic) |
| 存镜像的空间 | C 盘空闲 100GB 以上 | 硬盘空闲 100GB 以上 |
| 存数据的位置 | 必须有 D 盘,空闲 30GB 以上,数字人和作品数据都落在这 | 客户端 AppImage 直接跑 |
| 推荐配置 | i5-13400F / 32GB 内存 / RTX 4070 | 同左 |
C 盘紧张的话不用慌,装完 Docker 后可以在 Docker Desktop 的设置里把镜像位置指到另一个空闲大于 100GB 的磁盘文件夹:
服务端怎么拉起来
先把代码拿下来:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar服务端跑在 Docker 里,所以这一步的意义是把"跑服务的底座"先装好,容器后面全靠它。
- Ubuntu 先装 Docker 和 compose:
sudo apt update,然后sudo apt install docker.io docker-compose。再装 NVIDIA Container Toolkit 并配置nvidia-ctk runtime configure --runtime=docker,最后重启 docker——这一步是让 Docker 能"看见"你的显卡,缺了它容器里就没有算力。 - Windows 则用 WSL2 打底:
wsl --list --verbose看看装没装,没有就wsl --install,再wsl --update更新到最新版:
之后装好 Docker Desktop,首次启动接受协议、跳过登录即可。
底座就绪后,真正启动服务只有这一条命令:
cd deploy docker-compose up -d它会按 deploy/ 下的配置一键拉起三个容器。首次执行要耐心等:下载约 70GB,官方提示半小时左右、看网速,注意连 WiFi。如果报request canceled之类的连接错误,是 Docker Hub 官方源不稳定,在 Docker 设置里加国内镜像源(registry-mirrors)再重试就行。
看到 Docker 里出现三个 Running 的服务(asr、tts、gen-video)就算成功了。这里有两个可选变体:
- 只要视频生成能力,跑
docker-compose -f docker-compose-lite.yml up -d,只起一个Duix.Avatar-gen-video容器,吃资源最少; - 50 系新显卡(30/40 系搭配 CUDA 12.8 也可以)用
docker-compose -f docker-compose-5090.yml up -d,对应的是官方 torch 预览版方案。
装客户端,克隆你的第一个数字人
客户端不需要自己编译,直接去项目官方 Releases 下载:
- Windows:双击
Duix.Avatar-x.x.x-setup.exe安装; - Ubuntu:双击
Duix.Avatar-x.x.x.AppImage即可运行,无需安装。提醒一下,如果用 root 用户登录桌面,双击可能没反应,改到终端执行并加上--no-sandbox参数即可。
客户端本身就是全离线工具,主界面分成"我的数字人"和"我的作品"两栏,克隆出来的形象和生成的视频分别落在两边:
第一次克隆形象的操作要点:
- 📌 上传一段 10 秒左右、光线充足、背景简单的正面视频。
- ⚠️ 视频里必须有人声、而且在说话。官方 FAQ 明确写了:程序要用这段声音做声音克隆,静音视频会直接报错。
- 训练完成后,就能输入文案或上传音频来驱动数字人。文案支持英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语八种语言,文字会被合成为你的克隆音色,再和形象画面做口型同步,产出口播视频。
卡住或报错时,按这三步查
我踩过的坑基本都是下面这几类,按顺序排查效率最高:
- 看服务状态。客户端右上角菜单里检查三个服务是否都是 Running:
- 查显卡与驱动。
nvidia-smi出不了显卡信息,基本就是驱动没装好。 - 查日志。客户端日志从客户端菜单里导出;服务端日志点开 Docker 里对应容器的输出,把关键几行"复制"下来,再对照 官方 FAQ 搜关键词:
两个高频问题官方 FAQ 里都有现成答案:
- 克隆时报
Connection refused:一般是duix-avatar-asr启动慢,服务端刚起完等几分钟再操作;内存偏小(比如 16GB)的机器也可能起不来 ASR。 - 镜像下载失败:就是前面说的 Docker Hub 不稳定,换国内镜像源,必要时开全局代理。
还有一个容易忽略的动作:把服务端和客户端都更新到最新版。这个项目社区更新很频繁,到/deploy目录重新执行docker-compose up -d、客户端拉取新代码重新构建,很多问题在新版本里已经修掉了。
想二开:本地开放了哪些接口
如果你想把数字人能力接进自己的系统,Docker 起来后本地就暴露了几个 API(代码参照 src/main/service/ 下的 model.js、video.js、voice.js):
- 视频合成:
http://127.0.0.1:8383/easy/submit提交任务,http://127.0.0.1:8383/easy/query?code=任务code查进度; - 声音克隆:
http://127.0.0.1:18180/v1/preprocess_and_tran做音频预处理,http://127.0.0.1:18180/v1/invoke做音频合成。
参数细节都在 README_zh.md 的"开放 API"一节写得很清楚。最后交代一句商用边界:开源本地部署全球免费商用,但用户量超 10 万或年营收超 1000 万美元的企业需要签商业许可协议,条款见 LICENSE。
先去 deploy 目录跑通 lite 版,把第一个数字人克隆出来,再考虑上完整版和二开。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考