Duix.Avatar 完整指南:开源免费 AI 数字人克隆,10 秒视频造一个会说话的你
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款开源免费、完全离线的 AI 数字人工具包:录一段 10 秒的说话视频,克隆你的形象与声音,输入文字即可生成口型匹配的口播视频。不联网、不收费,数据留在你自己的电脑里。
先看结果:跑通之后你能得到什么
这节先给你看最终产出,让你判断它值不值得花半小时部署。
最终产出两样东西:一个会开口说话、口型对得上的"数字你"(形象+声音双克隆),以及基于它无限生成的口播视频。客户端主界面左侧直接创建视频,右侧克隆新数字人,你的所有数字人和作品都归档在列表里。
三点值得注意:
- 全程离线,素材、模型、成片都不离开你的电脑;
- 文案支持 8 种语言:中、英、日、韩、法、德、阿拉伯、西班牙语;
- 除文字外,音频文件也能直接驱动数字人。
能不能跑起来:系统与硬件要求一览
这节帮你先自查电脑配置,不达标就先别急着部署。
结论先行:NVIDIA 显卡 + 32G 内存 + 约 130G 空余磁盘,就能跑。所有算力都在本地,没有 NVIDIA 显卡,三个服务根本起不来。
| 检查项 | 要求 | 说明 |
|---|---|---|
| 系统 | Windows 10(19042.1526 及以上)或 Ubuntu 22.04 | 官方在这两套系统上验证过 |
| 显卡 | NVIDIA 显卡 + 已装官方驱动 | 硬性条件,Linux 可用nvidia-smi验证 |
| 内存 | 建议 32G | 16G 可能导致 ASR 服务起不来 |
| 磁盘(Windows) | C 盘 100G + D 盘 30G | C 盘存镜像,D 盘存数字人与作品数据 |
| 磁盘(Linux) | 空余 100G 以上 | |
| 流量 | 一次性下载约 70G 镜像 | 只在首次部署时消耗 |
| 参考配置 | i5-13400F / 32G / RTX 4070 | 官方推荐组合 |
最简部署路径:从零到三个服务跑起来
这节是全文唯一的"安装手册",按顺序做完即可。
架构很简单:三个 Docker 服务(ASR 语音识别、TTS 语音合成、视频生成)+ 一个桌面客户端。在 deploy/ 目录里执行一条 docker-compose 命令就能拉起。
Windows
- 准备 WSL 与 Docker
wsl --list --verbose # 查看是否已装 WSL,没有就先执行 wsl --install wsl --update # 更新 WSL再从 Docker 官网安装 Docker Desktop,首次启动接受协议、跳过登录。
- C 盘空间不够就改镜像存放位置
C 盘不足 100G 时,在 Docker Desktop 的 Settings → Resources → Advanced 里,把 "Disk image location" 改到空余 100G 以上的盘。
- 启动服务
cd deploy docker-compose up -d # 完整版:三个服务 # 只要视频生成服务时用精简版: docker-compose -f docker-compose-lite.yml up -d首次约需半小时(拉取镜像,视网速而定)。在 Docker Desktop 里看到三个容器均为Running,即部署成功。
NVIDIA 50 系显卡(5090 已实测,30/40 系 CUDA 12.8 也适用)用专用配置:
docker-compose -f docker-compose-5090.yml up -d
- 安装客户端
从项目发布页下载Duix.Avatar-x.x.x-setup.exe,双击安装即可。
Ubuntu 22.04
sudo apt update sudo apt install docker.io docker-compose再安装 NVIDIA 驱动与 NVIDIA Container Toolkit(完整步骤见 README.md 的 Ubuntu 章节),用nvidia-smi确认驱动正常,最后:
cd deploy docker-compose -f docker-compose-linux.yml up -d客户端为 AppImage 文件,双击运行;若以 root 用户双击无反应,在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox。
跑通之后:克隆你的第一个数字人并生成第一条口播视频
这节是第一个完整工作流,从一段素材视频到第一条口播成片,共四步。
第一步:录素材
10~20 秒的说话视频:正面、光线均匀、口齿清晰。视频里必须有人在说话——程序要用这段声音做声音克隆,无声素材会直接报错。
第二步:克隆数字人
客户端点 "Create Avatar" → 选择视频 → 提交。系统会把视频拆分成静音视频与音频,ASR 识别语音内容,TTS 建立声音模型。服务端刚启动后 ASR 服务本身需要几分钟就绪,别急着马上提交。
第三步:生成口播视频
选中刚建好的数字人,输入文案(8 种语言任选)或直接上传音频,点击生成。内部顺序是先合成音频,再用音频驱动视频完成口型对齐。
第四步:查看作品
成片自动进入 "My Works",可播放、删除、导出。
想跳过界面、把流程自动化,项目开放了本地 API(Docker 启动后均走127.0.0.1):
| 环节 | 接口 |
|---|---|
| 声音克隆训练 | POST http://127.0.0.1:18180/v1/preprocess_and_tran |
| 音频合成 | POST http://127.0.0.1:18180/v1/invoke |
| 视频合成 | POST http://127.0.0.1:8383/easy/submit |
| 进度查询 | GET http://127.0.0.1:8383/easy/query?code=taskCode |
请求与返回参数示例可直接看 src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js。
它还能干什么:能力与适用场景
这节回答"基础会用之后,还能拿它做什么"。
能力清单
- 多模型并存:可导入多个数字人统一管理,不同用途切不同"人";
- 文字与音频双驱动:音频输入会按节奏、语调带动口型与表情;
- 完全离线:断网可用,弱网、内网、隐私敏感场景都能跑;
- API 全开放:训练、合成、成片三个环节都接口化,可接入你自己的业务流。
适用场景
| 场景 | 用法 |
|---|---|
| 自媒体 / 短视频 | 同一批内容用不同数字人形象批量产出 |
| 课程培训 | 讲师形象统一,课件视频标准化 |
| 企业宣传 | 数字人口播产品介绍、FAQ 视频分担客服 |
| 多语言内容 | 同一内容出中、英、日等 8 语种版本 |
商用授权:开源代码支持全球免费商用;用户量超过 10 万或年营收超 1000 万美元的企业需签署商业许可协议(详见 LICENSE 及项目根目录的许可协议 PDF)。
卡住了怎么办:三类高频问题与快速定位
这节把高频故障按"卡在哪一步"合并成三类,每类给一条快速判断路径。
① 卡在服务启动(镜像下载失败 / 服务起不来)
最常见原因是连 Docker Hub 超时。解法:Docker Desktop → Settings → Docker Engine,在registry-mirrors里添加国内镜像源后重启。
镜像源没问题服务仍起不来,先查显卡驱动:本项目算力全在本地,没有 NVIDIA 显卡或服务,三个服务无法启动。
② 卡在数字人创建(模型训练)
- 报音频相关错误:多半是素材视频里没有说话声,或声音不是人声,重录素材;
Connection refused:ASR 服务启动慢,服务端起来后等几分钟再克隆;内存只有 16G 时 ASR 服务可能直接起不来,需要升级内存;- TTS 服务(heygen-tts)反复重启:直接查日志定位原因。
③ 卡在视频生成(进度不动 / 没有结果)
定位靠两份日志:
- 客户端日志:右上角 Settings → Open Log
- 服务端日志:Docker Desktop 里点对应服务的 Logs,用右侧复制按钮把完整日志带出去求助
通用自查三问(按顺序过一遍,能覆盖大多数情况):
- 三个服务是否全部
Running; - NVIDIA 显卡与驱动是否正常;
- 服务端与客户端是否都是最新版——到 deploy 目录重跑一次
docker-compose up -d即可更新服务端。
更多报错实例与解法见 doc/常见问题.md。
更快、更省、更省力:五条实用建议
这节不介绍新功能,只讲怎么省钱、省空间、省时间。
- 省盘:磁盘紧张就用精简版
docker-compose-lite.yml,只启动视频生成一个服务,镜像占用明显变小; - 提速:NVIDIA 50 系显卡用
docker-compose-5090.yml(PyTorch 官方预览版方案);镜像与数据放 SSD,模型加载更快; - 空间管理:定期删除不用的数字人和作品;数据默认落在
D:\duix_avatar_data,重要模型手动备份到外部存储; - 流量只花一次:约 70G 的镜像下载是首次成本,部署完成后续使用不再下载;
- 算一笔成本账:无授权费、不限量生成、无云端费用,持续成本基本为零。
| 项目 | 商业数字人服务 | Duix.Avatar 本地部署 |
|---|---|---|
| 授权 | 按年或按次收费 | 开源免费,支持免费商用 |
| 硬件 | 依赖云端算力 | 家用 NVIDIA 显卡一次性投入 |
| 网络 | 必须在线 | 完全离线,断网可用 |
| 数据 | 上传云端 | 本地duix_avatar_data目录 |
| 持续费用 | 按生成量计费 | 0 |
下一步去哪里
本周做:按本文部署路径把三个服务跑起来,录一段 10 秒自拍说话视频,完成第一次克隆和第一条口播视频。
然后做:打磨素材质量(光线、角度、音量),逐一试跑 8 种语言的内容生成。
再深入:把开放 API 接进你自己的工作流做批量自动化,代码示例见 src/main/service/。
配套资料:
- 完整安装与 Ubuntu 部署细节:README.md
- 报错实例与解决方案:doc/常见问题.md
- 部署配置目录:deploy/
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考