Duix-Avatar本地部署:3条命令跑通,1段10秒视频克隆数字人
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
想让视频里的真人开口讲稿,又不想去棚里反复录?Duix-Avatar 是一款免费开源的本地部署数字人工具:上传一段10秒左右的说话视频,离线克隆形象与声音,之后输入文案就能生成口型匹配的口播视频,数据全程不出本机。
环境要求清单与最快部署命令
| 组件 | 最低要求 | 推荐配置(官方建议) |
|---|---|---|
| 系统 | Windows 10(19042.1526 及以上)/ Ubuntu 22.04 | 同左 |
| CPU | 无明确下限 | i5-13400F(13代) |
| 内存 | 16GB(官方提示可能启动不了) | 32GB 及以上(必要) |
| 显卡 | 英伟达显卡 + 驱动 | RTX 4070 |
| 硬盘 | D盘 30GB+(数据)、C盘 100GB+(镜像) | 空闲 100GB 以上 |
🔧 1. 获取代码:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy- 启动服务端。
docker-compose up -d会自动拉取 ASR(语音识别)、TTS(语音合成)、视频合成 3 个镜像,下载约 70GB 流量,网速正常约半小时:
docker-compose up -d- 安装客户端:下载官方构建的安装包双击安装;或装 Node 18 后执行
npm run build自行构建。
✅ 验证:Docker 里 duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video 三个服务都是 Running,本机 18180、10095、8383 三个端口在监听。打开客户端新建一个模特能成功,就算跑通了。
Ubuntu 与 50 系显卡的启动命令见下文表格。
核心流程拆解:从一段视频到一条口播
用一段说话视频克隆形象与声音
做什么:把10秒左右的说话视频变成一个可复用的模特(形象+声音)。 怎么做:程序先用 ffmpeg 把视频转成 H.264(通用视频编码格式)并抽出音轨,音轨送 TTS 服务训练声音,再把模特视频、音频和声音编号一起存入本地数据库。 关键代码:模特创建服务、ffmpeg 音视频处理。
把文案变成你的音色
做什么:输入脚本文字,输出用你声音朗读的配音。 怎么做:客户端把文本发给 fish-speech 语音合成服务(端口 18180),以克隆步骤返回的参考音频和转写文本为依据,生成 wav 文件。 关键代码:TTS 接口封装。
音画合成出口播视频
做什么:把配音和模特视频合到一起,得到口型对齐的成片。 怎么做:把音频路径与视频路径提交到视频合成服务(8383/easy/submit),再用任务 code 轮询查询进度。 关键代码:视频合成服务、服务地址与数据目录。
素材准备规范与不同显卡的参数配置
素材规范:
- 模特视频约10秒,人物正面、说话清晰,必须带人声——声音克隆用的就是这段音轨;
- 无需手动剪辑:程序自动转 H.264、抽音频;音轨不足20秒会整体处理,不用预先切分;
- 数据默认写在
D:\duix_avatar_data(Windows),该盘预留30GB以上; - 脚本支持8种语言:中、英、日、韩、法、德、阿拉伯、西语。
不同机器选哪份部署文件:
| 档位 / 场景 | 启动命令(deploy 目录下) | 说明 |
|---|---|---|
| 全功能(32GB 内存 + RTX 4070 级) | docker-compose up -d | 3 个服务:识别 + 合成声音 + 合成视频 |
| 只合成视频(内存偏小) | docker-compose -f docker-compose-lite.yml up -d | 只起视频合成服务,配音需自备 |
| RTX 50 系(如 5090) | docker-compose -f docker-compose-5090.yml up -d | 使用 torch 官方预览版 |
| Ubuntu 22.04 桌面 | docker-compose -f docker-compose-linux.yml up -d | Linux 部署 |
提示:合成容器已默认带 8GB 共享内存与显存碎片控制参数(见 docker-compose.yml),一般不用动。
新手高频报错与排查方法
⚠️ 拉镜像报 request canceled / 连接超时:Docker Hub 官方源不稳定,在 daemon.json 里配置 registry-mirrors 国内镜像源后重启 Docker。
⚠️ 新增模特失败:模特视频必须有人声且是人在说话,程序用这段声音做克隆;静音或纯背景音乐的视频会直接报错。
⚠️ 克隆形象时报 Connection refused:ASR 服务启动慢,服务起来后等几分钟再操作;内存只有16G时可能根本起不来,建议32G。
⚠️ 三个服务全起不来:先执行nvidia-smi确认显卡与驱动。本项目算力全在本地,没有英伟达显卡或驱动装错,服务是起不来的。
⚠️ C盘空间不够:Docker Desktop 设置 → Resources → Advanced,把磁盘镜像位置改到剩余100GB+的盘。
更多报错案例见 常见问题文档。
适合谁,下一步做什么
Duix-Avatar 适合两类人:想本地批量产出口播视频、又不想把素材传上云的创作者;以及想直接调用 18180/10095/8383 三个本地端口做二次集成的开发者。建议先克隆一个模特、生成一条30秒短片感受效果,再对照 src/main/service 里的接口把自己的流程接进去。部署卡住时,优先看三个容器的 Logs 日志,大部分报错在文档里都有对应解法。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考