免费生成本地AI数字人视频:Duix.Avatar 数字人克隆完整上手指南
2026/9/11 8:32:11 网站建设 项目流程

免费生成本地AI数字人视频:Duix.Avatar 数字人克隆完整上手指南

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

你需要制作口播视频时,外包很贵,在线工具又担心数据隐私。Duix.Avatar 是一个免费开源的本地 AI 数字人视频生成工具:上传一段约 10 秒的视频即可克隆你的形象和声音,再输入文案或音频,就能离线生成数字人口播视频,全程不需要联网。

🧭 快速了解:一段 10 秒视频生成你的数字人

Duix.Avatar 由 Duix.com 开源,分两部分:

  • 服务端:Docker 部署,负责形象训练、声音克隆、视频合成,全部在本地 GPU 上运行
  • 客户端:桌面图形界面(Windows / Ubuntu 22.04),用来上传素材、填写文案、查看作品

输入是一段 10 秒左右的真人视频,输出是带口型、配你声音的播报视频。适合这些场景:个人口播内容批量制作、课程录播、企业内部宣传视频,且素材不出本机。

🚀 跑起来:Docker 三步部署本地服务

先确认硬件达标:NVIDIA 显卡(驱动装好,nvidia-smi能看到显卡)是硬性要求,官方推荐 i5-13400F + 32GB 内存 + RTX 4070;Windows 要求 D 盘空余 30GB 以上、C 盘 100GB 以上,Ubuntu 要求硬盘空余 100GB 以上。

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar

执行后会把整个项目下载到本地,包含客户端源码和deploy/部署目录。

Windows 需要先装好 Docker Desktop(首次下载约 70GB 流量,预留半小时);Ubuntu 用sudo apt install docker.io docker-compose安装。然后在部署目录启动服务:

cd deploy docker-compose up -d

执行后 Docker 会拉取 3 个镜像(ASR、TTS、视频合成)并在后台启动,看到三个容器都是 Running 状态即成功;lite 精简版只有 1 个服务Duix.Avatar-gen-video

客户端直接用官方构建的安装包:Windows 双击Duix.Avatar-x.x.x-setup.exe安装,Ubuntu 双击Duix.Avatar-x.x.x.AppImage启动。

🎬 用一次:克隆数字人并生成第一条视频

  1. 输入素材:准备一段自拍视频,时长至少 8 秒,分辨率 720P 以上,格式 MP4/MOV,全程只有你一个人,五官清晰不遮挡、吐字清晰。视频里的声音会被用来克隆音色,所以必须带人声。
  2. 定制模特:打开客户端,点击首页的「Create Avatar / 创建模特」,上传视频、填写模特名称,提交后系统开始本地训练,状态显示「训练中」,完成后出现在「My Avatars」列表里。
  3. 写文案:点击「Create Video / 创建视频」,选择刚做好的模特,在文本框输入内容(支持中英文,脚本支持英语、日语、中文等 8 种语言),或者上传一段音频(mp3/wav/flac/m4a,不超过 30 分钟),然后点击「合成视频」。
  4. 查看输出:到「My Works / 我的作品」查看进度,状态变为完成后可在线预览,也可以直接下载视频文件。

⚙️ 调优:部署方案与参数选择

方案启动命令说明
标准版docker-compose up -d3 个服务,含 ASR 和 TTS,功能完整
精简版 litedocker-compose -f docker-compose-lite.yml up -d只有视频合成 1 个服务,资源占用低
50 系显卡版docker-compose -f docker-compose-5090.yml up -d面向 5090 等 50 系显卡,基于 CUDA 12.8 的 30/40 系显卡也可用
Ubuntu 系统docker-compose -f docker-compose-linux.yml up -d需先装 NVIDIA Container Toolkit 并配置 docker runtime

其他参数建议:

  • 视频合成接口:服务启动后在http://127.0.0.1暴露端口,视频合成走8383端口,ASR/TTS 走18180端口,可自行脚本化批量生成
  • 音频素材:上传纯人声录音,背景音和噪音会直接影响合成效果
  • 更新服务:到deploy/目录重新执行docker-compose up -d即可拉取新版本

🛠️ 排坑:四个常见报错的解决方法

  • docker-compose up -d拉镜像超时(request canceled):Docker Hub 官方源不稳定,在 Docker 的daemon.json里添加registry-mirrors国内镜像源即可
  • 新增模特时报错:视频必须带人声且是人在说话,无声视频无法做声音克隆
  • 定制模特报Connection refused:ASR 服务启动慢,服务端启动后等几分钟再操作;内存 16GB 可能起不来,需要 32GB
  • 三个容器不是全部 Running:先跑nvidia-smi确认显卡驱动正常,本项目算力全部在本地,没有 NVIDIA 显卡或服务起不来

服务端日志直接在 Docker Desktop 里点开对应容器点「复制」;客户端日志在右上角「Setting → Open Log」。

更多报错对照 常见问题,部署文件在 deploy/,开放 API 的调用实现参考 src/main/service/。

下一步建议:按 Ubuntu 或 Windows 流程把服务端跑起来,用一段 10 秒的正面口播视频先克隆出第一个模特,再生成一条 30 秒的测试口播视频,确认口型和声音都正常后再批量产出内容。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询