Duix.Avatar 数字人克隆教程:免费开源,10 秒视频在你本地做出会说话的视频
2026/9/11 16:08:20 网站建设 项目流程

Duix.Avatar 数字人克隆教程:免费开源,10 秒视频在你本地做出会说话的视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款免费开源的 AI 数字人工具,支持全离线本地部署:只需一段 10 秒的讲话视频,就能完成外貌与声音克隆,输入文案或上传音频即可自动生成口型同步的口播视频。本指南面向自媒体创作者、培训讲师等想在自己电脑上产出数字人视频的用户。

🖥️ 动手前先核对你电脑:部署前必须确认的硬件条件

先说个扎心的事实:数字人本地部署失败,十有八九不是代码问题,而是硬件没达标。这一步判断错了,后面 30 分钟的下载和等待全部白费。

项目要求说明
显卡NVIDIA 显卡 + 正确安装的驱动(硬性条件)本项目所有算力都在本地,没有英伟达显卡或驱动,三个服务根本起不来
内存32GB 及以上(必要)16GB 内存可能导致语音识别服务启动不了
系统Windows 1019042.1526或更高,或 Ubuntu22.04Desktop其他 Linux 版本官方暂未测试
推荐配置i5-13400F、RTX 4070社区反馈 8GB 显存的显卡也可跑
磁盘(Windows)D 盘空闲30GB+(存数字人与作品数据),C 盘空闲100GB+(存 Docker 镜像)C 盘不足时可改镜像存放位置,见下图
磁盘(Ubuntu)空闲空间100GB+建议连 WiFi 再开始

驱动是否装好,装完后执行nvidia-smi验证:能打印出显卡信息就是装好了。如果你用的是NVIDIA 50 系列显卡(30/40 系列 CUDA 12.8 也可选此方案),部署时要用专门的 compose 文件,第 2 节会写到。

C 盘空间不足 100G 时,在 Docker Desktop 的 Resources → Advanced 里把 Disk image location 改到空闲空间更大的磁盘。

🚀 30 分钟完成数字人服务端本地部署:3 条命令与 70G 流量

这一节只有几条命令,但背后是约70GB的镜像下载量,官方预期耗时半小时左右,网速决定了你实际要等多久。先克隆代码(以仓库 README 为准,目录名为Duix-Avatar):

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

Windows 用户分两步走:

  1. 先确认 WSL(Windows 里的 Linux 子系统,Docker Desktop 靠它运行):执行wsl --list --verbose,没装过就先wsl --install,再用wsl --update更新到最新版。
  2. 从 Docker 官网下载 Windows 版安装包安装,首次启动时接受协议、跳过登录即可。

然后进入服务端部署。compose 文件都放在 deploy/ 目录,标准版执行:

cd deploy docker-compose up -d

两个备选:显存紧张、只想体验视频合成功能,用 lite 版docker-compose -f docker-compose-lite.yml up -d(只启动 1 个服务);50 系列显卡执行docker-compose -f docker-compose-5090.yml up -d

Ubuntu 用户则先装 Docker 和显卡运行环境,再指定 linux 版 compose 文件:

sudo apt update sudo apt install docker.io sudo apt install docker-compose

之后按 README_zh.md 的指引安装 NVIDIA 驱动与 nvidia-container-toolkit(执行sudo nvidia-ctk runtime configure --runtime=docker并重启 Docker),再运行docker-compose -f docker-compose-linux.yml up -d

成功的标志:打开 Docker,看到 3 个服务都是 Running 状态——duix-avatar-ttsduix-avatar-asrduix-avatar-gen-video(lite 版只有最后一个)。数据默认存在D:\duix_avatar_data\,无需额外配置。

🎬 装好客户端 5 分钟,产出第一条数字人视频

服务端全部 Running 后,安装客户端打开它,后面就再不用碰命令行了:Windows 双击官方安装包Duix.Avatar-x.x.x-setup.exe即可;Ubuntu 直接运行Duix.Avatar-x.x.x.AppImage(以 root 用户登录桌面时,需在终端加--no-sandbox参数启动)。

打开后整个界面就两条主线,对应你接下来的全部操作:

主界面:上方是"创建视频"和"创建数字人"两个入口,下方"My Works(我的作品)"和"My Avatars(我的数字人)"用来管理产出。

第一步,克隆数字人。点击 "Create Avatar",上传一段10 秒左右(建议 10~20 秒)的视频。这里有一条硬性要求:视频里必须有人正在说话,因为程序要从中克隆你的声音;另外脸部要清晰、尽量正面、光线充足,太短或没人声的视频会直接报错。

第二步,生成视频。在 "My Avatars" 里选中刚克隆的数字人,进入创建视频页面:输入要说的文案(脚本支持中、英、日、韩、法、德、阿、西 8 种语言),或直接上传现成的音频文件,点击生成。系统会自动把文字转成你的克隆音色,再驱动口型,产出口播视频。生成进度卡住时的排查方法见第 4 节。

第三步,管理作品。所有成片都进 "My Works",支持关键词搜索和分页浏览,方便翻历史作品、二次使用。

右上角的 Setting 菜单里可以打开客户端日志(排障要用)、查看用户协议、切换界面语言,多语言内容创作时直接在这里切语言即可:

Setting 菜单提供打开日志、用户协议、语言切换三个入口;"我的作品"按时间排列所有已生成的数字人视频。

⚠️ 数字人视频生成 3 类高频报错的排查思路

社区里出现的报错,归归类其实就下面三种占了绝大多数,按出现频率从高到低说。

1.docker-compose up -d拉镜像失败,报request canceled/context canceled本质是 Docker Hub 官方源连接不稳定。最直接的解法是给 Docker 配镜像加速源:Docker Desktop → Settings → Docker Engine,在 JSON 配置里加registry-mirrors数组(填当前可用的加速地址),Apply & restart 后重跑部署命令:

Docker Engine 设置页中的 registry-mirrors 字段,即镜像加速源列表。

2. 新增模特(克隆数字人)报错,提示音频流不存在(如Output file #0 does not contain any stream)。原因几乎只有一个:上传的克隆视频里没有清晰的人声。声音是声音克隆的原料,视频无声、或只有背景音乐,程序无米下锅。换一段本人在正常说话的片段重传即可。

3. 定制数字人报Connection refused,或 TTS 服务反复重启。前者的典型原因是语音识别服务(asr)启动较慢,服务端刚起来就急着操作,连接被拒;正确做法是等服务全部 Running 后再等几分钟再克隆,且内存必须 32GB 起步(16GB 可能直接起不来)。后者先点开duix-avatar-tts的 Logs 看是不是音频路径报错,典型日志如下:

TTS 服务日志里反复出现file does not exists,说明音频文件路径有误,重启服务或检查duix_avatar_data\voice\data目录即可。

以上都解决不了时,按顺序自查:三个服务是否都 Running →nvidia-smi是否显示显卡 → 服务端客户端是否都是最新版(服务端到 deploy/ 重跑docker-compose up -d)。客户端日志在 Setting → Open Log 处获取,本地文件长这样:

客户端日志文件main.log的位置,提问或求助时附上它能省掉一半的沟通成本。

更多历史问题整理在 doc/常见问题.md,提问前建议先翻一遍。

🔍 10 秒视频是怎么变成会说话的视频:一条流水线上的 3 个服务

你可能会好奇:一段 10 秒视频,凭什么就能造出会说新内容的数字人?答案藏在三个各司其职的 Docker 服务里,它们串成一条本地流水线:

  1. duix-avatar-asr(基于 FunASR):把语音转成文字,负责"听懂"克隆视频里你说了什么。
  2. duix-avatar-tts(基于 fish-speech):文本转语音,用你克隆的音色朗读新文案。
  3. duix-avatar-gen-video:核心合成引擎,把你原始视频的画面和新生成的语音对齐,逐帧驱动口型,输出最终成片。

对应到本地 API(仅http://127.0.0.1可调,全程不经过外网):克隆阶段调18180端口的preprocess_and_tran接口(视频拆成静音视频 + 音频、建立声音参考),音频合成调18180invoke接口,视频合成调8383easy/submit提交、easy/query查进度。客户端里这些调用都替你封装好了,源码逻辑集中在 src/main/service/ 下的voice.jsmodel.jsvideo.js,想二次开发可以从这里读起。

排障时点开任意服务的 Logs 标签页,点右侧复制按钮即可导出完整日志。

📺 开源数字人工具对普通用户最实用的 2 个场景

自媒体口播:不想露脸、又需要持续日更的创作者,用数字人分身代替出镜,文案交给 TTS,一天批量产出多条口播视频;8 种脚本语言意味着同一形象可以直接产出多语种内容,铺海外平台不再依赖翻译口播。

培训与教学:讲师克隆一次形象后,课程更新只需改文案,无需反复进棚录制,形象、音色、节奏全程保持一致。批量、重复、需要"同一张脸"说新内容的工作,都是这套离线数字人方案最省时间的地方。

顺带提醒一句授权:本项目支持全球免费商用,但用户量超 10 万或年营收达 1000 万美元以上的企业需签署商业许可协议,商用前看一眼 LICENSE 总没错。

部署完成、跑通第一条视频后,建议你把 doc/常见问题.md 收藏起来——之后 90% 的报错答案都在里面;遇到新问题,先按第 4 节的三步自查法收集日志,再去找社区,效率最高。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询