Duix.Avatar 完整指南:开源免费 AI 数字人克隆,10 秒视频造一个会说话的你
2026/9/11 3:29:07 网站建设 项目流程

Duix.Avatar 完整指南:开源免费 AI 数字人克隆,10 秒视频造一个会说话的你

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款开源免费、完全离线的 AI 数字人工具包:录一段 10 秒的说话视频,克隆你的形象与声音,输入文字即可生成口型匹配的口播视频。不联网、不收费,数据留在你自己的电脑里。

先看结果:跑通之后你能得到什么

这节先给你看最终产出,让你判断它值不值得花半小时部署。

最终产出两样东西:一个会开口说话、口型对得上的"数字你"(形象+声音双克隆),以及基于它无限生成的口播视频。客户端主界面左侧直接创建视频,右侧克隆新数字人,你的所有数字人和作品都归档在列表里。

三点值得注意:

  • 全程离线,素材、模型、成片都不离开你的电脑;
  • 文案支持 8 种语言:中、英、日、韩、法、德、阿拉伯、西班牙语;
  • 除文字外,音频文件也能直接驱动数字人。

能不能跑起来:系统与硬件要求一览

这节帮你先自查电脑配置,不达标就先别急着部署。

结论先行:NVIDIA 显卡 + 32G 内存 + 约 130G 空余磁盘,就能跑。所有算力都在本地,没有 NVIDIA 显卡,三个服务根本起不来。

检查项要求说明
系统Windows 10(19042.1526 及以上)或 Ubuntu 22.04官方在这两套系统上验证过
显卡NVIDIA 显卡 + 已装官方驱动硬性条件,Linux 可用nvidia-smi验证
内存建议 32G16G 可能导致 ASR 服务起不来
磁盘(Windows)C 盘 100G + D 盘 30GC 盘存镜像,D 盘存数字人与作品数据
磁盘(Linux)空余 100G 以上
流量一次性下载约 70G 镜像只在首次部署时消耗
参考配置i5-13400F / 32G / RTX 4070官方推荐组合

最简部署路径:从零到三个服务跑起来

这节是全文唯一的"安装手册",按顺序做完即可。

架构很简单:三个 Docker 服务(ASR 语音识别、TTS 语音合成、视频生成)+ 一个桌面客户端。在 deploy/ 目录里执行一条 docker-compose 命令就能拉起。

Windows

  1. 准备 WSL 与 Docker
wsl --list --verbose # 查看是否已装 WSL,没有就先执行 wsl --install wsl --update # 更新 WSL

再从 Docker 官网安装 Docker Desktop,首次启动接受协议、跳过登录。

  1. C 盘空间不够就改镜像存放位置

C 盘不足 100G 时,在 Docker Desktop 的 Settings → Resources → Advanced 里,把 "Disk image location" 改到空余 100G 以上的盘。

  1. 启动服务
cd deploy docker-compose up -d # 完整版:三个服务 # 只要视频生成服务时用精简版: docker-compose -f docker-compose-lite.yml up -d

首次约需半小时(拉取镜像,视网速而定)。在 Docker Desktop 里看到三个容器均为Running,即部署成功。

NVIDIA 50 系显卡(5090 已实测,30/40 系 CUDA 12.8 也适用)用专用配置:docker-compose -f docker-compose-5090.yml up -d

  1. 安装客户端

从项目发布页下载Duix.Avatar-x.x.x-setup.exe,双击安装即可。

Ubuntu 22.04

sudo apt update sudo apt install docker.io docker-compose

再安装 NVIDIA 驱动与 NVIDIA Container Toolkit(完整步骤见 README.md 的 Ubuntu 章节),用nvidia-smi确认驱动正常,最后:

cd deploy docker-compose -f docker-compose-linux.yml up -d

客户端为 AppImage 文件,双击运行;若以 root 用户双击无反应,在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox

跑通之后:克隆你的第一个数字人并生成第一条口播视频

这节是第一个完整工作流,从一段素材视频到第一条口播成片,共四步。

第一步:录素材

10~20 秒的说话视频:正面、光线均匀、口齿清晰。视频里必须有人在说话——程序要用这段声音做声音克隆,无声素材会直接报错。

第二步:克隆数字人

客户端点 "Create Avatar" → 选择视频 → 提交。系统会把视频拆分成静音视频与音频,ASR 识别语音内容,TTS 建立声音模型。服务端刚启动后 ASR 服务本身需要几分钟就绪,别急着马上提交。

第三步:生成口播视频

选中刚建好的数字人,输入文案(8 种语言任选)或直接上传音频,点击生成。内部顺序是先合成音频,再用音频驱动视频完成口型对齐。

第四步:查看作品

成片自动进入 "My Works",可播放、删除、导出。

想跳过界面、把流程自动化,项目开放了本地 API(Docker 启动后均走127.0.0.1):

环节接口
声音克隆训练POST http://127.0.0.1:18180/v1/preprocess_and_tran
音频合成POST http://127.0.0.1:18180/v1/invoke
视频合成POST http://127.0.0.1:8383/easy/submit
进度查询GET http://127.0.0.1:8383/easy/query?code=taskCode

请求与返回参数示例可直接看 src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js。

它还能干什么:能力与适用场景

这节回答"基础会用之后,还能拿它做什么"。

能力清单

  • 多模型并存:可导入多个数字人统一管理,不同用途切不同"人";
  • 文字与音频双驱动:音频输入会按节奏、语调带动口型与表情;
  • 完全离线:断网可用,弱网、内网、隐私敏感场景都能跑;
  • API 全开放:训练、合成、成片三个环节都接口化,可接入你自己的业务流。

适用场景

场景用法
自媒体 / 短视频同一批内容用不同数字人形象批量产出
课程培训讲师形象统一,课件视频标准化
企业宣传数字人口播产品介绍、FAQ 视频分担客服
多语言内容同一内容出中、英、日等 8 语种版本

商用授权:开源代码支持全球免费商用;用户量超过 10 万或年营收超 1000 万美元的企业需签署商业许可协议(详见 LICENSE 及项目根目录的许可协议 PDF)。

卡住了怎么办:三类高频问题与快速定位

这节把高频故障按"卡在哪一步"合并成三类,每类给一条快速判断路径。

① 卡在服务启动(镜像下载失败 / 服务起不来)

最常见原因是连 Docker Hub 超时。解法:Docker Desktop → Settings → Docker Engine,在registry-mirrors里添加国内镜像源后重启。

镜像源没问题服务仍起不来,先查显卡驱动:本项目算力全在本地,没有 NVIDIA 显卡或服务,三个服务无法启动。

② 卡在数字人创建(模型训练)

  • 报音频相关错误:多半是素材视频里没有说话声,或声音不是人声,重录素材;
  • Connection refused:ASR 服务启动慢,服务端起来后等几分钟再克隆;内存只有 16G 时 ASR 服务可能直接起不来,需要升级内存;
  • TTS 服务(heygen-tts)反复重启:直接查日志定位原因。

③ 卡在视频生成(进度不动 / 没有结果)

定位靠两份日志:

  • 客户端日志:右上角 Settings → Open Log
  • 服务端日志:Docker Desktop 里点对应服务的 Logs,用右侧复制按钮把完整日志带出去求助

通用自查三问(按顺序过一遍,能覆盖大多数情况):

  1. 三个服务是否全部Running
  2. NVIDIA 显卡与驱动是否正常;
  3. 服务端与客户端是否都是最新版——到 deploy 目录重跑一次docker-compose up -d即可更新服务端。

更多报错实例与解法见 doc/常见问题.md。

更快、更省、更省力:五条实用建议

这节不介绍新功能,只讲怎么省钱、省空间、省时间。

  1. 省盘:磁盘紧张就用精简版docker-compose-lite.yml,只启动视频生成一个服务,镜像占用明显变小;
  2. 提速:NVIDIA 50 系显卡用docker-compose-5090.yml(PyTorch 官方预览版方案);镜像与数据放 SSD,模型加载更快;
  3. 空间管理:定期删除不用的数字人和作品;数据默认落在D:\duix_avatar_data,重要模型手动备份到外部存储;
  4. 流量只花一次:约 70G 的镜像下载是首次成本,部署完成后续使用不再下载;
  5. 算一笔成本账:无授权费、不限量生成、无云端费用,持续成本基本为零。
项目商业数字人服务Duix.Avatar 本地部署
授权按年或按次收费开源免费,支持免费商用
硬件依赖云端算力家用 NVIDIA 显卡一次性投入
网络必须在线完全离线,断网可用
数据上传云端本地duix_avatar_data目录
持续费用按生成量计费0

下一步去哪里

本周做:按本文部署路径把三个服务跑起来,录一段 10 秒自拍说话视频,完成第一次克隆和第一条口播视频。

然后做:打磨素材质量(光线、角度、音量),逐一试跑 8 种语言的内容生成。

再深入:把开放 API 接进你自己的工作流做批量自动化,代码示例见 src/main/service/。

配套资料:

  • 完整安装与 Ubuntu 部署细节:README.md
  • 报错实例与解决方案:doc/常见问题.md
  • 部署配置目录:deploy/

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询