Duix-Avatar 本地部署教程:30 分钟离线部署免费的 AI 数字人克隆工具
2026/9/11 17:14:21 网站建设 项目流程

Duix-Avatar 本地部署教程:30 分钟离线部署免费的 AI 数字人克隆工具

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

公司拍条口播宣传片,找外包数字人平台按分钟收费,还要把人脸视频传到对方服务器,心里总不踏实。Duix-Avatar 是一款免费开源的本地 AI 数字人工具包:一段 10 秒视频就能克隆你的形象和声音,输入文字或音频就自动生成口播视频,全程离线,数据不出你的电脑。跟着本文走,半小时左右就能在自己电脑上跑起这套离线数字人服务。

Duix-Avatar 到底是什么

云端的商业数字人 SaaS,脸和声音要先传到别人的服务器,生成还按次计费。传统 3D 建模做数字人更贵,一套流程下来成本以十万美元计。Duix-Avatar 走的是另一条路:完全离线的架构,三个本地 Docker 服务(语音识别、语音合成、视频合成)包办全部计算,不联网也能出片。

几个最实际的优点:

  • 10 秒视频克隆:上传一段你说话的视频,形象和声音同时克隆下来,不用分两步。
  • 全离线运行:视频、声音、模型全部存在本机 D 盘,适合在意隐私的个人和团队。
  • 脚本支持 8 种语言:中、英、日、韩、法、德、阿拉伯、西语,一个模型多国复用。

项目采用开源协议,支持全球免费商用(超大企业规模需签商业许可),背后团队已用这套技术帮上万家企业做出过 50 万个数字分身。

快速上手:最短路径把服务跑起来

先确认你的机器够格。Windows 用户最低要求如下(Ubuntu 22.04 也可以,配置要求类似):

  • 系统:Windows 10 19042.1526 或更高
  • 内存:32GB(16GB 勉强,后面会讲到坑)
  • 硬盘:C 盘 ≥100GB 存镜像,D 盘 ≥30GB 存数字人数据
  • 显卡:必须有 NVIDIA 显卡且装好驱动,推荐 RTX 4070 起步
nvidia-smi # 能打出显卡信息,说明驱动没问题

第 1 步:装好 Docker

所有服务都跑在 Docker 容器里,这一步就是把容器环境搭起来。Windows 上先检查 WSL 并在终端更新它,然后去 Docker 官网下载安装 Docker Desktop:

wsl --update # 更新 WSL,没装的话先执行 wsl --install

第 2 步:给 Docker 腾出足够空间

镜像总共约 70GB,默认存在 C 盘。如果 C 盘不够,在 Docker Desktop 的 设置 → Resources → Advanced 里点 Browse,把镜像位置挪到空间充足的磁盘:

💡小贴士:镜像位置选错盘是最常见的翻车点,挪完记得点 Apply & restart 再退出。

第 3 步:克隆仓库,一条命令起服务

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d # 后台拉起全部服务,首次拉镜像约 70GB

⚠️注意:首次下载耗时半小时以上,务必连 Wi-Fi 或有线网络,别用公司限速的公网。

第 4 步:确认服务跑起来了

打开 Docker Desktop,看到三个服务全部 Running 即成功。然后从项目官方发布页下载客户端安装包,双击Duix.Avatar-x.x.x-setup.exe装好,打开客户端能连上本地服务,就算部署完成:

核心能力:它到底能干什么

能力一:10 秒视频克隆"你自己"

用户视角:客户端点"Create Avatar",上传一段 10 秒左右的说话视频,稍等片刻,你的数字分身就建好了。背后原理:系统先把视频拆成"静音视频 + 音频",视频拿去建形象模型,音频拿去克隆声音,两套模型各管一半。如果你只想调一个参数:视频一定要带清晰人声,这是克隆声音的唯一素材。

能力二:文字或音频驱动口型播报

用户视角:在"Create Video"里贴上文案,点生成,几分钟后就是一段你本人在口播的视频。也可以直接上传录好的音频,让数字人跟着你的语调念。背后是三个服务接力:TTS 把文字变成你的声音(本地端口18180),ASR 处理你上传的音频(端口10095),合成服务把音画对齐(端口8383)。建议:追求自然度就直接上传真人录音,比 TTS 转换更有情绪起伏。

能力三:开放本地 API,方便接进自己的业务

三个服务在本地各开一个端口,全是http://127.0.0.1的 HTTP 接口,想批量出片或嵌进自己的系统,直接发请求就行:

服务本地端口负责的事
视频合成8383口型合成,提交任务查进度
语音合成18180用克隆的声音读文案
语音识别10095把音频转成文字

具体请求格式可以看仓库里src/main/service/下的model.jsvideo.jsvoice.js三个文件,客户端本身就是这样调的。

实战调优:让体验再上一档

  • 口播号批量产片:建好模型后每天只改文案,同一分身可轮流出中、日、英多语言版本,脚本语言在生成时切换即可。
  • 宣传片替身配音:现场只拍你的画面,声音用克隆 TTS 后期合成,省掉重录一遍台词的时间。

两条调优建议:

  • 内存只有 16GB 的机器:ASR 服务启动很慢,服务端起来后等几分钟再建模型;能升级到 32GB 最省心。
  • 5090 等新显卡用户:别用默认配置,改跑docker-compose -f docker-compose-5090.yml up -d,这是官方给 50 系显卡准备的专用方案(30/40 系用 CUDA 12.8 也可用)。
  • 端口8383被占用时:把docker-compose.yml里的'8383:8383'改成'8384:8383'再重启。

避坑手册:新手最常撞的 3 个墙

症状:docker-compose up -d拉镜像失败,报registry-1.docker.io ... request canceled

原因:Docker Hub 官方源连接不稳定。解法:Docker Desktop 打开 Docker Engine 设置页,加上国内镜像加速器(registry-mirrors配置),Apply & restart 后重新拉取。

症状:新建模特时报错,克隆形象失败。

原因:你上传的视频没有声音,或者画面里的人没在说话——声音克隆全靠这段音频。解法:重拍一段 10 秒左右、人声清晰的说话视频再传。

症状:定制模特时报Connection refused

原因:ASR 服务启动比别的慢,你操作太快了;内存小于 32GB 时也可能起不来。解法:服务端启动后等几分钟再克隆;内存不够就加内存。查看具体报错可以去 Docker Desktop 点开对应容器看 Logs:

现在就动手

拍一段 10 秒的说话视频,把第一个数字人口播片生成出来。卡住了先翻仓库里的doc/常见问题.md和 README 的"提问前自查"一节,再看客户端 设置 → Open Log 的日志,最后去项目 GitHub 的 Issues 里搜,很多坑别人已经踩过并写好了答案。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询