Duix.Avatar数字人克隆完整教程:用10秒视频克隆你自己的AI数字人
2026/9/11 3:03:18 网站建设 项目流程

Duix.Avatar数字人克隆完整教程:用10秒视频克隆你自己的AI数字人

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款免费开源的 AI 数字人工具。用一段 10 秒视频即可完成数字人克隆,输入文案就能得到口播视频,全程在本地运行。零基础用户 30 分钟可完成部署并产出第一个成片。

🎬 它能帮你做什么

克隆出属于自己的 AI 数字人后,最直接的改变是:你不用再每次都亲自出镜拍视频。

Duix.Avatar 只需要一段 10 秒左右的视频,就能同时克隆你的形象和声音。之后你输入文案、或直接上传音频,数字人就会开口说话,输出口型同步的口播视频。整个流程离线完成,素材不会离开你的电脑。

它适合这几类场景:

  • 自媒体创作者:不用约棚、不用化妆,写完文案就能出片,还能当天切换语种。
  • 教师与培训机构:把课程要点做成标准演示视频,节奏可反复使用,不用重录。
  • 企业用户:产品介绍、宣传物料里用同一个数字人形象,全部视频保持一致。
  • 个人用户:给家人做一段生日祝福或纪念视频,成本只是一段拍摄时间。

项目完全免费开源,你可以修改和扩展源码,也欢迎有技术背景的人参与社区共建。

📋 动手前:环境自检清单

开始之前先核对 4 项,全部通过再往下走,缺一项就先解决:

  • 系统:Windows 10(19042.1526 或更高版本)或 Ubuntu 22.04
  • 显卡:NVIDIA RTX 30、40、50 系列,并已安装驱动
  • 内存:32GB 及以上
  • 磁盘:100GB 以上可用空间;Windows 用户 C 盘存服务镜像,D 盘存生成数据

不达标怎么办:本项目算力全在本地,内存低于 32GB、或没有 NVIDIA 显卡时,服务会起不来或非常慢,建议先升级配置再跟本教程。

🚀 从零跑起来:部署三步走

三步做完,本地部署数字人所需的服务端就跑起来了:装 Docker、起服务端、装客户端。

先获取一次项目代码:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar

一键安装Docker

Windows 用户先打开 PowerShell,用wsl --list --verbose检查 WSL 是否已安装,再用wsl --update更新 WSL,然后从 Docker 官网安装 Docker Desktop。

Ubuntu 用户在终端执行:

sudo apt update sudo apt install docker.io sudo apt install docker-compose

成功标志:docker --version能输出版本号,或系统托盘里 Docker 图标正在运行。

如果要调整 WSL2 镜像所在的磁盘位置,打开 Docker Desktop 设置里的 Resources,用 Browse 修改 Disk image location,参考下图:

30分钟拉起3个服务端

进入项目deploy/目录。Windows 用户执行:

docker-compose up -d

Ubuntu 用户执行:

docker-compose -f docker-compose-linux.yml up -d

首次拉取镜像约 30 分钟,取决于网速。成功标志:Docker 里出现 3 个运行中的服务。

安装客户端

Windows 用户从官方仓库的发行版页面下载对应系统的安装包,双击Duix.Avatar-x.x.x-setup.exe完成安装。

Ubuntu 用户直接运行.AppImage文件即可,无需安装。如果 root 用户下双击打不开,改用终端:

./Duix.Avatar-x.x.x.AppImage --no-sandbox

成功标志:客户端主界面打开,能看到 Create Avatar 入口。

🎥 第一次使用:从10秒视频到成片

客户端打开后,跟着 10 秒视频克隆步骤走 3 步,就能拿到你的第一个数字人。

上传10-20秒克隆素材

点击 Create Avatar,上传素材视频。素材有 3 个硬要求:

  • 人脸清晰、正对镜头,模糊素材会直接训练失败
  • 视频里的人必须真的在说话,声音也是从这段视频克隆的
  • 时长建议 10-20 秒,太短提取不到足够特征

等待模型训练

上传后系统自动分析视频,提取面部和声音特征,耗时几分钟,显卡越强越快。完成后,"My Avatars" 列表里会出现你的新形象。

输入文案生成口播成片

选中刚创建好的模型,输入要说的文案,或直接上传音频文件,点击生成。等几分钟,一段口型同步的口播视频就出来了。

⚙️ 进阶玩法

切换8种语言

客户端右上角设置菜单里选 Language switch。界面和生成内容都支持 8 种语言:中、英、日、韩、法、德、阿、西。

调用3类API接口

Docker 启动后,服务会在 127.0.0.1 上暴露 8383 和 18180 两个端口,你可以用程序驱动数字人。接口分三类:

  • 模型训练:提交声音素材,完成语音预处理
  • 音频合成:把文本转成数字人语音
  • 视频合成:提交音频与视频,再按 code 查询进度直到成片

参数示例看src/main/service/下的model.jsvoice.jsvideo.js三个文件,可直接当 API 文档读。

批量生成数字人视频

需要大量内容时,用脚本循环调用视频合成接口,逐个查询进度。系统内部有任务队列,不用额外担心并发问题。

🔍 原理速览

后端其实是三个微服务:fun-asr 负责语音识别(音频转文本),fish-speech-ziming 负责语音合成(文本转语音),数字人视频合成引擎负责最后的口型渲染。

数据流分 4 个阶段:视频预处理提取面部和声音 → 模型训练得到专属模型 → 语音合成把文案变成声音 → 视频合成输出成片。

🛠️ 避坑手册

遇到问题先查日志:客户端在设置菜单的 Open Log 里打开;服务端日志在 Docker 里直接看。

镜像拉取失败或超时

现象:docker-compose 长时间停住,镜像下载失败。 原因:连接 Docker Hub 的网络不稳定。 解法:配置国内镜像源。Ubuntu 在/etc/docker/daemon.json里添加registry-mirrors,Windows 在 Docker Desktop 设置里配置镜像源,具体源地址以官方文档为准。

服务起不来

现象:容器很快退出,或 3 个服务不全是 Running。 原因:没有 NVIDIA 显卡,或驱动没装好,本项目算力全部在本地。 解法:执行nvidia-smi验证,能输出显卡信息说明驱动正常,否则重装驱动。

端口被占用

现象:服务启动时报端口冲突。 原因:8383 或 18180 被其他程序占用。 解法:找到占用端口的进程结束掉,再重新执行启动命令。

数字人创建失败

现象:素材上传后训练失败,或生成的模型不可用。 原因:视频里人脸不清晰,或没有清晰的说话声音。 解法:重拍素材,正面、光线充足、吐字清晰,时长控制在 10-20 秒。

生成进度卡在20%

现象:视频生成进度停在 20% 不动。 原因:音频处理环节出错。 解法:打开 heygen-tts 服务日志,找file not exists一类的报错,重启相关服务后重新生成。

⚡ 效率贴士

素材拍摄 4 要点:

  • 面部光线充足、均匀
  • 正面拍摄,避免侧脸和遮挡
  • 吐字清晰,声音克隆效果就取决于这段视频
  • 背景简洁,方便识别人脸

生成效率 3 建议:

  • 按需求选分辨率,不必硬上最高档
  • 批量生成时分批提交,别一次堆几十个任务
  • 定期清理临时文件,释放磁盘空间

结语

这套开源 AI 数字人工具让你 30 分钟内在本地完成数字人克隆与数字人视频生成,不花钱、不联网。卡住时先翻 doc/常见问题.md,多数问题都有标准答案;仍解决不了就去项目仓库提 issue,社区更新很活跃。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询