Duix.Avatar数字人克隆完整教程:用10秒视频克隆你自己的AI数字人
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款免费开源的 AI 数字人工具。用一段 10 秒视频即可完成数字人克隆,输入文案就能得到口播视频,全程在本地运行。零基础用户 30 分钟可完成部署并产出第一个成片。
🎬 它能帮你做什么
克隆出属于自己的 AI 数字人后,最直接的改变是:你不用再每次都亲自出镜拍视频。
Duix.Avatar 只需要一段 10 秒左右的视频,就能同时克隆你的形象和声音。之后你输入文案、或直接上传音频,数字人就会开口说话,输出口型同步的口播视频。整个流程离线完成,素材不会离开你的电脑。
它适合这几类场景:
- 自媒体创作者:不用约棚、不用化妆,写完文案就能出片,还能当天切换语种。
- 教师与培训机构:把课程要点做成标准演示视频,节奏可反复使用,不用重录。
- 企业用户:产品介绍、宣传物料里用同一个数字人形象,全部视频保持一致。
- 个人用户:给家人做一段生日祝福或纪念视频,成本只是一段拍摄时间。
项目完全免费开源,你可以修改和扩展源码,也欢迎有技术背景的人参与社区共建。
📋 动手前:环境自检清单
开始之前先核对 4 项,全部通过再往下走,缺一项就先解决:
- 系统:Windows 10(19042.1526 或更高版本)或 Ubuntu 22.04
- 显卡:NVIDIA RTX 30、40、50 系列,并已安装驱动
- 内存:32GB 及以上
- 磁盘:100GB 以上可用空间;Windows 用户 C 盘存服务镜像,D 盘存生成数据
不达标怎么办:本项目算力全在本地,内存低于 32GB、或没有 NVIDIA 显卡时,服务会起不来或非常慢,建议先升级配置再跟本教程。
🚀 从零跑起来:部署三步走
三步做完,本地部署数字人所需的服务端就跑起来了:装 Docker、起服务端、装客户端。
先获取一次项目代码:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar一键安装Docker
Windows 用户先打开 PowerShell,用wsl --list --verbose检查 WSL 是否已安装,再用wsl --update更新 WSL,然后从 Docker 官网安装 Docker Desktop。
Ubuntu 用户在终端执行:
sudo apt update sudo apt install docker.io sudo apt install docker-compose成功标志:docker --version能输出版本号,或系统托盘里 Docker 图标正在运行。
如果要调整 WSL2 镜像所在的磁盘位置,打开 Docker Desktop 设置里的 Resources,用 Browse 修改 Disk image location,参考下图:
30分钟拉起3个服务端
进入项目deploy/目录。Windows 用户执行:
docker-compose up -dUbuntu 用户执行:
docker-compose -f docker-compose-linux.yml up -d首次拉取镜像约 30 分钟,取决于网速。成功标志:Docker 里出现 3 个运行中的服务。
安装客户端
Windows 用户从官方仓库的发行版页面下载对应系统的安装包,双击Duix.Avatar-x.x.x-setup.exe完成安装。
Ubuntu 用户直接运行.AppImage文件即可,无需安装。如果 root 用户下双击打不开,改用终端:
./Duix.Avatar-x.x.x.AppImage --no-sandbox成功标志:客户端主界面打开,能看到 Create Avatar 入口。
🎥 第一次使用:从10秒视频到成片
客户端打开后,跟着 10 秒视频克隆步骤走 3 步,就能拿到你的第一个数字人。
上传10-20秒克隆素材
点击 Create Avatar,上传素材视频。素材有 3 个硬要求:
- 人脸清晰、正对镜头,模糊素材会直接训练失败
- 视频里的人必须真的在说话,声音也是从这段视频克隆的
- 时长建议 10-20 秒,太短提取不到足够特征
等待模型训练
上传后系统自动分析视频,提取面部和声音特征,耗时几分钟,显卡越强越快。完成后,"My Avatars" 列表里会出现你的新形象。
输入文案生成口播成片
选中刚创建好的模型,输入要说的文案,或直接上传音频文件,点击生成。等几分钟,一段口型同步的口播视频就出来了。
⚙️ 进阶玩法
切换8种语言
客户端右上角设置菜单里选 Language switch。界面和生成内容都支持 8 种语言:中、英、日、韩、法、德、阿、西。
调用3类API接口
Docker 启动后,服务会在 127.0.0.1 上暴露 8383 和 18180 两个端口,你可以用程序驱动数字人。接口分三类:
- 模型训练:提交声音素材,完成语音预处理
- 音频合成:把文本转成数字人语音
- 视频合成:提交音频与视频,再按 code 查询进度直到成片
参数示例看src/main/service/下的model.js、voice.js、video.js三个文件,可直接当 API 文档读。
批量生成数字人视频
需要大量内容时,用脚本循环调用视频合成接口,逐个查询进度。系统内部有任务队列,不用额外担心并发问题。
🔍 原理速览
后端其实是三个微服务:fun-asr 负责语音识别(音频转文本),fish-speech-ziming 负责语音合成(文本转语音),数字人视频合成引擎负责最后的口型渲染。
数据流分 4 个阶段:视频预处理提取面部和声音 → 模型训练得到专属模型 → 语音合成把文案变成声音 → 视频合成输出成片。
🛠️ 避坑手册
遇到问题先查日志:客户端在设置菜单的 Open Log 里打开;服务端日志在 Docker 里直接看。
镜像拉取失败或超时
现象:docker-compose 长时间停住,镜像下载失败。 原因:连接 Docker Hub 的网络不稳定。 解法:配置国内镜像源。Ubuntu 在/etc/docker/daemon.json里添加registry-mirrors,Windows 在 Docker Desktop 设置里配置镜像源,具体源地址以官方文档为准。
服务起不来
现象:容器很快退出,或 3 个服务不全是 Running。 原因:没有 NVIDIA 显卡,或驱动没装好,本项目算力全部在本地。 解法:执行nvidia-smi验证,能输出显卡信息说明驱动正常,否则重装驱动。
端口被占用
现象:服务启动时报端口冲突。 原因:8383 或 18180 被其他程序占用。 解法:找到占用端口的进程结束掉,再重新执行启动命令。
数字人创建失败
现象:素材上传后训练失败,或生成的模型不可用。 原因:视频里人脸不清晰,或没有清晰的说话声音。 解法:重拍素材,正面、光线充足、吐字清晰,时长控制在 10-20 秒。
生成进度卡在20%
现象:视频生成进度停在 20% 不动。 原因:音频处理环节出错。 解法:打开 heygen-tts 服务日志,找file not exists一类的报错,重启相关服务后重新生成。
⚡ 效率贴士
素材拍摄 4 要点:
- 面部光线充足、均匀
- 正面拍摄,避免侧脸和遮挡
- 吐字清晰,声音克隆效果就取决于这段视频
- 背景简洁,方便识别人脸
生成效率 3 建议:
- 按需求选分辨率,不必硬上最高档
- 批量生成时分批提交,别一次堆几十个任务
- 定期清理临时文件,释放磁盘空间
结语
这套开源 AI 数字人工具让你 30 分钟内在本地完成数字人克隆与数字人视频生成,不花钱、不联网。卡住时先翻 doc/常见问题.md,多数问题都有标准答案;仍解决不了就去项目仓库提 issue,社区更新很活跃。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考