Duix-Avatar本地部署:3条命令跑通,1段10秒视频克隆数字人
2026/9/11 2:29:10 网站建设 项目流程

Duix-Avatar本地部署:3条命令跑通,1段10秒视频克隆数字人

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

想让视频里的真人开口讲稿,又不想去棚里反复录?Duix-Avatar 是一款免费开源的本地部署数字人工具:上传一段10秒左右的说话视频,离线克隆形象与声音,之后输入文案就能生成口型匹配的口播视频,数据全程不出本机。

环境要求清单与最快部署命令

组件最低要求推荐配置(官方建议)
系统Windows 10(19042.1526 及以上)/ Ubuntu 22.04同左
CPU无明确下限i5-13400F(13代)
内存16GB(官方提示可能启动不了)32GB 及以上(必要)
显卡英伟达显卡 + 驱动RTX 4070
硬盘D盘 30GB+(数据)、C盘 100GB+(镜像)空闲 100GB 以上

🔧 1. 获取代码:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy
  1. 启动服务端。docker-compose up -d会自动拉取 ASR(语音识别)、TTS(语音合成)、视频合成 3 个镜像,下载约 70GB 流量,网速正常约半小时:
docker-compose up -d
  1. 安装客户端:下载官方构建的安装包双击安装;或装 Node 18 后执行npm run build自行构建。

✅ 验证:Docker 里 duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video 三个服务都是 Running,本机 18180、10095、8383 三个端口在监听。打开客户端新建一个模特能成功,就算跑通了。

Ubuntu 与 50 系显卡的启动命令见下文表格。

核心流程拆解:从一段视频到一条口播

用一段说话视频克隆形象与声音

做什么:把10秒左右的说话视频变成一个可复用的模特(形象+声音)。 怎么做:程序先用 ffmpeg 把视频转成 H.264(通用视频编码格式)并抽出音轨,音轨送 TTS 服务训练声音,再把模特视频、音频和声音编号一起存入本地数据库。 关键代码:模特创建服务、ffmpeg 音视频处理。

把文案变成你的音色

做什么:输入脚本文字,输出用你声音朗读的配音。 怎么做:客户端把文本发给 fish-speech 语音合成服务(端口 18180),以克隆步骤返回的参考音频和转写文本为依据,生成 wav 文件。 关键代码:TTS 接口封装。

音画合成出口播视频

做什么:把配音和模特视频合到一起,得到口型对齐的成片。 怎么做:把音频路径与视频路径提交到视频合成服务(8383/easy/submit),再用任务 code 轮询查询进度。 关键代码:视频合成服务、服务地址与数据目录。

素材准备规范与不同显卡的参数配置

素材规范:

  • 模特视频约10秒,人物正面、说话清晰,必须带人声——声音克隆用的就是这段音轨;
  • 无需手动剪辑:程序自动转 H.264、抽音频;音轨不足20秒会整体处理,不用预先切分;
  • 数据默认写在D:\duix_avatar_data(Windows),该盘预留30GB以上;
  • 脚本支持8种语言:中、英、日、韩、法、德、阿拉伯、西语。

不同机器选哪份部署文件:

档位 / 场景启动命令(deploy 目录下)说明
全功能(32GB 内存 + RTX 4070 级)docker-compose up -d3 个服务:识别 + 合成声音 + 合成视频
只合成视频(内存偏小)docker-compose -f docker-compose-lite.yml up -d只起视频合成服务,配音需自备
RTX 50 系(如 5090)docker-compose -f docker-compose-5090.yml up -d使用 torch 官方预览版
Ubuntu 22.04 桌面docker-compose -f docker-compose-linux.yml up -dLinux 部署

提示:合成容器已默认带 8GB 共享内存与显存碎片控制参数(见 docker-compose.yml),一般不用动。

新手高频报错与排查方法

⚠️ 拉镜像报 request canceled / 连接超时:Docker Hub 官方源不稳定,在 daemon.json 里配置 registry-mirrors 国内镜像源后重启 Docker。

⚠️ 新增模特失败:模特视频必须有人声且是人在说话,程序用这段声音做克隆;静音或纯背景音乐的视频会直接报错。

⚠️ 克隆形象时报 Connection refused:ASR 服务启动慢,服务起来后等几分钟再操作;内存只有16G时可能根本起不来,建议32G。

⚠️ 三个服务全起不来:先执行nvidia-smi确认显卡与驱动。本项目算力全在本地,没有英伟达显卡或驱动装错,服务是起不来的。

⚠️ C盘空间不够:Docker Desktop 设置 → Resources → Advanced,把磁盘镜像位置改到剩余100GB+的盘。

更多报错案例见 常见问题文档。

适合谁,下一步做什么

Duix-Avatar 适合两类人:想本地批量产出口播视频、又不想把素材传上云的创作者;以及想直接调用 18180/10095/8383 三个本地端口做二次集成的开发者。建议先克隆一个模特、生成一条30秒短片感受效果,再对照 src/main/service 里的接口把自己的流程接进去。部署卡住时,优先看三个容器的 Logs 日志,大部分报错在文档里都有对应解法。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询