从10秒视频到数字分身:Duix.Avatar本地部署的完整路径
2026/9/11 23:01:30 网站建设 项目流程

从10秒视频到数字分身:Duix.Avatar本地部署的完整路径

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一个完全开源的数字人工具包:你上传一段 10 秒左右的视频,它就能克隆你的形象和声音,之后输入文案或音频,本地即可生成口播视频。全程离线,不需要把影像资料传到任何服务器。下面按"先体检、再部署、会排障、能二开"的顺序,把我跑通这套流程的关键判断都写出来,你照着走就能在自己电脑上跑起来。

跑之前先认识它的三个服务

装之前值得花一分钟搞懂它由什么组成,后面排障会省事很多。

  • 整个服务端是三个 Docker 容器,都在本地占用 NVIDIA 显卡算力:duix-avatar-asr(语音识别,基于 FunASR)、duix-avatar-tts(声音克隆,基于 fish-speech)、duix-avatar-gen-video(口型与视频合成)。端口分别是 10095、18180、8383,定义在 deploy/docker-compose.yml 里。
  • 客户端是 Electron + Vue 写的桌面应用,负责上传素材、管理数字人和作品,数据存在本地 SQLite,视频处理交给 src/main/util/ffmpeg.js。
  • 数据流是"说话视频 → 拆出画面和声音 → 分别训练 → 新文案驱动口型",首尾都在你本机完成,这是它全离线能力的来源。

显卡、驱动、硬盘:三道必答题

必须是一张 NVIDIA 显卡,且驱动装好了。这一点没有商量余地——官方文档原话是:本项目所有算力都在本地,没有英伟达显卡或没有驱动程序,三个服务是启动不了的。推荐配置是 13 代 i5-13400F、32GB 内存(文档标注为必要项)、RTX 4070;16GB 内存的机器则可能起不来 ASR 服务,后面排障一节还会提到。

装完驱动后在终端敲一下nvidia-smi,能看到显卡型号和驱动版本就说明显卡这道题通过了。

硬盘方面,首次部署要下载约 70GB 的镜像流量,所以空间要提前留足:

检查项WindowsUbuntu 22.04
系统版本Win10 19042.1526 或更高官方完成适配验证的是 22.04 Desktop(内核 6.8.0-52-generic)
存镜像的空间C 盘空闲 100GB 以上硬盘空闲 100GB 以上
存数据的位置必须有 D 盘,空闲 30GB 以上,数字人和作品数据都落在这客户端 AppImage 直接跑
推荐配置i5-13400F / 32GB 内存 / RTX 4070同左

C 盘紧张的话不用慌,装完 Docker 后可以在 Docker Desktop 的设置里把镜像位置指到另一个空闲大于 100GB 的磁盘文件夹:

服务端怎么拉起来

先把代码拿下来:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

服务端跑在 Docker 里,所以这一步的意义是把"跑服务的底座"先装好,容器后面全靠它。

  • Ubuntu 先装 Docker 和 compose:sudo apt update,然后sudo apt install docker.io docker-compose。再装 NVIDIA Container Toolkit 并配置nvidia-ctk runtime configure --runtime=docker,最后重启 docker——这一步是让 Docker 能"看见"你的显卡,缺了它容器里就没有算力。
  • Windows 则用 WSL2 打底:wsl --list --verbose看看装没装,没有就wsl --install,再wsl --update更新到最新版:

之后装好 Docker Desktop,首次启动接受协议、跳过登录即可。

底座就绪后,真正启动服务只有这一条命令:

cd deploy docker-compose up -d

它会按 deploy/ 下的配置一键拉起三个容器。首次执行要耐心等:下载约 70GB,官方提示半小时左右、看网速,注意连 WiFi。如果报request canceled之类的连接错误,是 Docker Hub 官方源不稳定,在 Docker 设置里加国内镜像源(registry-mirrors)再重试就行。

看到 Docker 里出现三个 Running 的服务(asr、tts、gen-video)就算成功了。这里有两个可选变体:

  • 只要视频生成能力,跑docker-compose -f docker-compose-lite.yml up -d,只起一个Duix.Avatar-gen-video容器,吃资源最少;
  • 50 系新显卡(30/40 系搭配 CUDA 12.8 也可以)用docker-compose -f docker-compose-5090.yml up -d,对应的是官方 torch 预览版方案。

装客户端,克隆你的第一个数字人

客户端不需要自己编译,直接去项目官方 Releases 下载:

  • Windows:双击Duix.Avatar-x.x.x-setup.exe安装;
  • Ubuntu:双击Duix.Avatar-x.x.x.AppImage即可运行,无需安装。提醒一下,如果用 root 用户登录桌面,双击可能没反应,改到终端执行并加上--no-sandbox参数即可。

客户端本身就是全离线工具,主界面分成"我的数字人"和"我的作品"两栏,克隆出来的形象和生成的视频分别落在两边:

第一次克隆形象的操作要点:

  • 📌 上传一段 10 秒左右、光线充足、背景简单的正面视频。
  • ⚠️ 视频里必须有人声、而且在说话。官方 FAQ 明确写了:程序要用这段声音做声音克隆,静音视频会直接报错。
  • 训练完成后,就能输入文案或上传音频来驱动数字人。文案支持英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语八种语言,文字会被合成为你的克隆音色,再和形象画面做口型同步,产出口播视频。

卡住或报错时,按这三步查

我踩过的坑基本都是下面这几类,按顺序排查效率最高:

  1. 看服务状态。客户端右上角菜单里检查三个服务是否都是 Running:

  1. 查显卡与驱动。nvidia-smi出不了显卡信息,基本就是驱动没装好。
  2. 查日志。客户端日志从客户端菜单里导出;服务端日志点开 Docker 里对应容器的输出,把关键几行"复制"下来,再对照 官方 FAQ 搜关键词:

两个高频问题官方 FAQ 里都有现成答案:

  • 克隆时报Connection refused:一般是duix-avatar-asr启动慢,服务端刚起完等几分钟再操作;内存偏小(比如 16GB)的机器也可能起不来 ASR。
  • 镜像下载失败:就是前面说的 Docker Hub 不稳定,换国内镜像源,必要时开全局代理。

还有一个容易忽略的动作:把服务端和客户端都更新到最新版。这个项目社区更新很频繁,到/deploy目录重新执行docker-compose up -d、客户端拉取新代码重新构建,很多问题在新版本里已经修掉了。

想二开:本地开放了哪些接口

如果你想把数字人能力接进自己的系统,Docker 起来后本地就暴露了几个 API(代码参照 src/main/service/ 下的 model.js、video.js、voice.js):

  • 视频合成:http://127.0.0.1:8383/easy/submit提交任务,http://127.0.0.1:8383/easy/query?code=任务code查进度;
  • 声音克隆:http://127.0.0.1:18180/v1/preprocess_and_tran做音频预处理,http://127.0.0.1:18180/v1/invoke做音频合成。

参数细节都在 README_zh.md 的"开放 API"一节写得很清楚。最后交代一句商用边界:开源本地部署全球免费商用,但用户量超 10 万或年营收超 1000 万美元的企业需要签商业许可协议,条款见 LICENSE。

先去 deploy 目录跑通 lite 版,把第一个数字人克隆出来,再考虑上完整版和二开。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询