Duix.Avatar:用一台普通电脑生成数字人视频的完整指南
2026/9/11 8:41:58 网站建设 项目流程

Duix.Avatar:用一台普通电脑生成数字人视频的完整指南

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

花几万块外包一条数字人口播视频,其实你自己那台电脑就能干。Duix.Avatar 是一个完全开源的 AI 数字人本地部署工具:录一段 10 秒左右的视频,它就能克隆你的形象和声音,之后输入文案或上传音频,直接生成你"出镜"口播的视频。内容创作者、做课程的老师、开网店的主播,第一次接触照着这套流程也能跑通。

这个项目能帮你做什么

Duix.Avatar 干的事很简单:把你本人变成一个可以反复生成的视频演员。

  • 10 秒视频克隆形象和声音
  • 全程离线,素材不上传
  • 文字或音频驱动口型同步
  • 脚本支持 8 种语言播报

所谓口型同步(简单说就是嘴型跟得上说的话),是这类工具好不好用的核心,它的合成结果就是音视频严格对齐的口播视频。

开工前先把环境备好

硬件要什么级别

先看你的电脑够不够格。官方给的是推荐配置,"最低"一栏是它明确标注的硬性条件:

项目最低门槛官方推荐
CPUi5 级别(官方未给最低型号)13 代 i5-13400F
内存32GB(官方标注"必要")32GB 及以上
显卡必须是 NVIDIA 显卡RTX 4070
硬盘100GB 空闲100GB 以上,Windows 另需 D 盘 30GB

注意显卡只认 N 卡:项目所有算力都在本地,没有 N 卡或驱动没装好,后面三个服务根本起不来。AMD 卡目前指望不上。

软件装到位了吗

以 Windows(10 19042 或更高版本)为例,逐条过一遍:

  1. 没装过 WSL(Windows 里跑 Linux 的子系统)就先装:wsl --install
  2. 更新 WSL 内核:wsl --update
  3. 去官网下载 Docker Desktop(Docker 是把整套服务打包成免安装镜像运行的工具)的 Windows 版安装包,装完启动,首次运行接受协议、跳过登录
  4. 验证显卡驱动:nvidia-smi,能打印出显卡信息才算数
  5. 验证 Docker:docker --version

C 盘空间不足 100GB 的话,Docker 装好后可以在设置里把镜像存储位置挪到别的盘,入口在 Settings → Resources → Advanced → Disk image location。

从零跑通:部署到出片

拉代码并起容器

先拉项目代码:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar

然后进入仓库的 deploy/ 目录执行docker-compose up -d。这一步会拉三个服务镜像,总共约 70GB 流量,官方说大概半小时左右,速度取决于你的网速,建议连 WiFi 干等。机器配置吃紧的话可以改用精简版,只有一个服务:docker-compose -f docker-compose-lite.yml up -d。如果你是 50 系新显卡(30/40 系搭配 CUDA 12.8 也能用这套),换配置文件:docker-compose -f docker-compose-5090.yml up -d

确认三个服务都活着

容器起来了,怎么确认没装歪?跑一句docker ps,完整版应该看到三个容器都是 Running 状态:Duix.Avatar-tts(语音合成,占端口 18180)、Duix.Avatar-asr(语音识别,占端口 10095)、Duix.Avatar-gen-video(视频渲染,占端口 8383);lite 版只有一个Duix.Avatar-gen-video

服务端就绪后装客户端:去项目官方发布页下载 Windows 安装包,双击Duix.Avatar-x.x.x-setup.exe装完即可。

建第一个数字人形象

打开客户端,进"创建数字人"页面,上传一段 10 到 15 秒的正面视频。有个隐藏门槛:视频里必须是你本人在清晰说话,因为系统要拿这段声音做声音克隆,纯画面没声音的素材会直接报错。拍的时候背景简单、光线均匀、脸占画面大一点,后面的克隆效果会稳很多。提交后等状态变成完成,"我的数字人"列表里就多了一个你的分身。

出第一条视频

服务都跑起来了,怎么把第一条视频生出来?点"创建视频",选中刚克隆好的形象,直接输入文案(或上传一段音频),提交生成。系统会先合成语音,再让形象对口型,最后拼成完整视频。文案支持中文、英文、日、韩、法、德、阿拉伯、西语共 8 种语言,生成的成品会自动出现在"我的作品"里,下载就能用。

再往深里玩一玩

装好能干活了,还能玩出什么花?如果你会写点代码,服务端其实把整条流水线都开放成了 API(应用程序接口,简单说就是让程序之间互相调用的入口),全在http://127.0.0.1本地:

  • 声音克隆:先把参考音频放到D:\duix_avatar_data\voice\data,调http://127.0.0.1:18180/v1/preprocess_and_tran,返回里的asr_format_audio_urlreference_audio_text要记下来
  • 语音合成:调http://127.0.0.1:18180/v1/invoke,带上text和上一步记下的两个字段,吐回 wav 音频
  • 视频合成:调http://127.0.0.1:8383/easy/submit,传audio_urlvideo_url和一个唯一code,再用http://127.0.0.1:8383/easy/query?code=你的code轮询进度

具体参数写法可以看客户端源码里的src/main/service/video.jsvoice.js。批量生成(一次循环提交多段文案)和换背景做系列内容,都是在这套接口上套循环就能实现的事,这里就不展开了。

踩了这些坑就不算白折腾 ⚠️

  • 症状docker-compose up -dregistry-1.docker.io连接超时。原因:Docker Hub 官方源在国内不稳定。解法:给 Docker 配国内镜像源,Docker Engine 设置里按官方文档加registry-mirrors后点 Apply & restart。

  • 症状:容器反复重启或根本起不来。原因:没装 N 卡,或显卡驱动没装对。解法:先跑nvidia-smi,打不出显卡信息就去更新驱动再来。

  • 症状:克隆形象时报Connection refused原因:ASR 语音识别服务启动比较慢,还没就绪。解法:三个服务全 Running 后再等几分钟,再提交克隆任务;内存只有 16GB 的机器可能压根起不动,32GB 是硬门槛。

  • 症状:新增模特时莫名其妙报错。原因:上传的视频没有声音,或不是人在说话。解法:换一段有清晰人声的素材重新提交。

排查时别瞎猜,三个服务的运行日志就在 Docker 界面点开对应容器的 Logs 页签里,把关键报错复制出来对照 常见问题 文档基本都能定位。

一台配得过去的 N 卡电脑,加上这套开源数字人方案,从克隆到出片全程离线,成本就是电费。项目细节和完整 FAQ 都在仓库里的 README_zh.md,照着跑,今晚你就能拥有自己的数字分身。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询