Duix.Avatar 本地部署教程:一段 10 秒视频克隆数字人,Docker 拉起三个服务
2026/9/11 16:50:28 网站建设 项目流程

Duix.Avatar 本地部署教程:一段 10 秒视频克隆数字人,Docker 拉起三个服务

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是硅基智能开源的 AI 数字人工具:上传一段 10 秒左右的视频,克隆出你的形象和声音,之后输入文案或上传音频,就能生成口型同步的口播视频,从上传素材到出片全程本地离线跑完。适合想自己搭一套数字人出镜、又不想按次付费调商业 API 的独立开发者和内容创作者。

一、项目速览

  • 解决什么问题:真人出镜成本高、商业数字人服务按量收费且素材要出内网,Duix.Avatar 让形象与声音的复刻完全留在本机。
  • 核心能力:约 10 秒视频即可克隆形象与声音,文字或音频驱动口型,视频脚本支持中、英、日、韩等 8 种语言。
  • 部署形态:本地 Docker 部署,3 个 GPU 容器(ASR、TTS、视频合成)+ 一个 Electron 客户端,全离线。
  • 技术栈关键词:Electron、Vue3、Docker 编排,ASR 基于 fun-asr,声音克隆基于 fish-speech 改造,客户端本地用 better-sqlite3 存模型与作品。

二、跑起来之前

配置要求

项目最低推荐
系统Windows 10 19042.1526+ / Ubuntu 22.04 Desktop同左
GPUNVIDIA 显卡 + 正确驱动(RTX 30 系起)RTX 4070,显存 ≥ 12G
内存16G(ASR 容器可能起不来)32G+(官方标注必要)
磁盘100G 空闲(Windows 下 C 盘存镜像)另备 30G+ 放数据盘

依赖安装

Windows:先确认 WSL 在位,装不上就重试几次:

wsl --list --verbose wsl --install

再到 Docker 官网按 CPU 架构下载 Docker Desktop 安装。C 盘紧张时,可在 Docker Desktop 的 Settings → Resources → Advanced 里把 Disk image location 挪到空闲更大的磁盘。

Ubuntu:装 Docker 与 NVIDIA Container Toolkit,驱动装完用nvidia-smi验证:

sudo apt update sudo apt install docker.io docker-compose sudo nvidia-ctk runtime configure --runtime=docker sudo systemctl restart docker

三、从零到第一次出结果

  1. :把仓库拉到本地(git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar),执行
cd /deploy docker-compose up -d

看到:三个容器(duix-avatar-asr / duix-avatar-gen-video / duix-avatar-tts)全部 Running,分别占用 10095、8383、18180 端口。拉镜像约耗 30 分钟、70G 左右流量,注意走 WiFi。

⚠ 如果卡在这里——拉镜像报registry-1.docker.io超时,通常是 Docker Hub 连不通。给 Docker 配置国内镜像源(Settings → Docker Engine 里加 registry-mirrors)后重跑上面的命令。

⚠ 如果卡在这里——NVIDIA 50 系显卡(5090)用户请改用docker-compose -f docker-compose-5090.yml up -d,该方案基于 torch 预览版构建。

  1. :装 Electron 客户端。执行:从 Releases 下载对应系统安装包,Windows 双击 setup.exe;Ubuntu 双击 AppImage,打不开就加参数./Duix.Avatar-x.x.x.AppImage --no-sandbox看到:首页出现 Create Video 与 Create Avatar 两个入口,即与本机服务连通成功。

  2. :确认数据目录就绪。Windows 端客户端会把素材写进D:\duix_avatar_data执行:确认 D 盘存在且空闲 30G+(这是 compose 文件里 volume 挂载约定的路径)。看到:后续克隆与合成不会再报文件不存在。

四、核心功能上手

10 秒视频克隆一个形象。我上传的是一段 10 秒左右、单人正面说话的 mp4,点 Create Avatar 后客户端自动把素材拆成静音视频和音轨:音轨走 fun-asr 识别出文字,再作为声音克隆的参考样本。几分钟后,My Avatars 列表里出现一张带创建时间戳的形象卡片。

⚠ 如果卡在这里——新增模特直接失败,通常是素材视频没有人声。程序要靠这段声音做声音克隆,纯画面素材必挂,重录一段开口说话的即可。

文案驱动口播视频。接着点 Create Video:左侧选刚克隆的音色,输入框里贴一段产品介绍的文案,先点试听确认语气,再点合成。几分钟内 My Works 里多出一条口型与音频对齐的视频,可以直接导出。

批量出片可以绕过客户端直接打本地接口,链路依次是模特训练(/v1/preprocess_and_tran)、音频合成(/v1/invoke)、视频合成(/easy/submit),请求参数在 src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js 里都有现成封装。同一个人设素材配中文、英文两版文案各出一遍,就是同一数字人的多语言版本。

五、排障速查

拉镜像报 registry-1.docker.io 超时原因:Docker Hub 官方源连接不稳定,国内网络尤其常见。动作:给 Docker 加 registry-mirrors 后重新docker-compose up -d,参考 doc/常见问题.md 第 1 条的现成配置。

新增模特直接失败原因:素材视频没有清晰人声,声音克隆缺参考样本。动作:重录一段 10 秒以上、正面清晰开口说话的视频再提交。

克隆形象报 Connection refused原因:ASR 容器冷启动慢,服务端刚拉起几分钟内调不通 10095 端口。动作:等 2–3 分钟重试;16G 内存的机器可能起不来,直接换 32G。

生成进度卡在 20%原因:heygen-tts 容器日志里循环出现File not exists异常,说明音频文件没落到容器约定目录(Windows 下是 D 盘映射)。动作:核对 compose 里的卷挂载路径与盘符是否真实存在,重启该容器。

六、实际能用来做什么

日更口播:每天固定时段发同一数字人出镜的视频。流程是写好当天 5 条 30 秒文案,逐条走文案 → 合成,人工只审口型与断句。数字人负责出镜,人负责文案和审核,省掉打光、布景和录制时间。

一人两语:同一个人设素材,中文和英文文案各生成一版,分别投国内账号和海外账号,不用另拍一套素材。

无人值守批量:脚本直接调三个本地接口批量提交,夜里挂机跑一批短视频,早上验收导出即可。

七、继续深入

服务端编排看 deploy/docker-compose.yml,三个容器的端口、GPU 与数据盘挂载都在这一个文件里;客户端侧的请求封装可对照 src/main/service/ 下三个模块。遇到问题先翻 doc/常见问题.md,再对着容器日志逐条核。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询