UVR5 人声分离轻量方案:Retrieval-based-Voice-Conversion-WebUI 快速上手
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
录完一段播客,回放时发现环境噪音和混响把原话盖掉了一半;或者想拿一首歌做清唱练习,却找不到官方发布的纯伴奏。这类需求不必打开大型工作站,Retrieval-based-Voice-Conversion-WebUI 里内置的 UVR5 模块就能在浏览器界面里把一段混合音频拆成"主人声轨"和"其余轨道",普通电脑即可运行。
方案定位:谁适合用这套 AI 人声分离
适合三类人:有基本命令行操作习惯但没做过音频处理的人;手里有一批音频、需要批量拆轨的人;想先拿到干净人声再去训练变声模型的人。选它的理由很实际:模型权重、推理逻辑、批量入口都打包在项目里,下载完权重就能跑,不需要自己搭训练环境。整条数据流可以概括为:
UVR5 环境搭建:克隆仓库与依赖安装
- 克隆项目到本地并进入目录:
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI- 安装依赖按显卡区分:NVIDIA 用户直接
pip install -r requirements.txt(CUDA 环境);AMD 显卡换requirements-amd.txt;核显或想用 DirectML 的机器用requirements-dml.txt;Python 3.11 环境另有requirements-py311.txt。 - 启动 WebUI:Windows 双击
go-web.bat;Linux 或 macOS 执行bash run.sh,该脚本会自动建 Python 3.8 虚拟环境、补齐依赖并拉取全部模型权重(UVR5 权重落在assets/uvr5_weights/,其余模型落在assets/下各目录)。 - ⚠️ 内存低于 8GB 时建议关掉浏览器多余标签和其他大程序,否则加载权重阶段可能卡死。
- 浏览器打开后进入"伴奏人声分离&去混响&去回声"页签,就是分离入口。
WebUI 里做人声分离:上传、选模型与调参
上传音频与选模型
输入区二选一:填"输入待处理音频文件夹路径"(文件夹内文件逐个处理),或直接批量拖入音频文件。模型下拉框列出assets/uvr5_weights/里已有的.pth权重,界面说明里把模型归成三组:
- 保留人声:HP2、HP3,适合不带和声的录音,HP3 可能轻微漏进伴奏,但主人声保留略好;
- 仅保留主人声:HP5,适合带和声的音频,代价是对主人声略有削弱;
- 去混响、去延迟:MDX-Net(onnx_dereverb)对双通道混响效果最好,但不能处理单通道混响;DeEcho 系列去除延迟效果,其中 DeEcho-DeReverb 额外去混响、可处理单声道混响,耗时约为其他 DeEcho 模型的两倍。
调参数并运行
聚合度(Agg)默认值是 10,取值范围 0–20。分离越"狠"数值越大,但耗时同步上涨。何时该调:第一遍跑完觉得人声轨里还残留伴奏,就把数值往上抬 2~3 再跑;反过来人声发薄、出现断裂,就往回调。低配机器保持 10 或更低即可,不建议直接拉满。
导出格式可选 wav / flac / mp3 / m4a,默认 flac。中间环节要再加工就选 wav 保真;只是留档试听选 flac 或 mp3,体积更省。
输出目录"指定输出主人声文件夹"和"指定输出非主人声文件夹"要分别填不同路径,两个都填opt的话结果会混在同一目录里。
配置完成后点"转换",下方输出信息框会逐行回显每个文件的处理结果。
验收与微调
跑完后优先听人声轨:残留伴奏明显就加聚合度重跑;人声变薄就降回去。目标是去混响时,作者推荐的组合是先过 MDX-Net 再过 DeEcho-Aggressive。音频较长时先切成小段分别处理、再拼接结果,能明显降低单次占用的内存。
人声分离参数怎么调:三个高频场景的配置对照
| 你的需求 | 推荐配置 | 效果预期 |
|---|---|---|
| 播客去混响去延迟 | 双通道录音:MDX-Net 后接 DeEcho-Aggressive;单通道:DeEcho-DeReverb;格式选 flac | 回放里的房间混响与延迟被压掉,人声贴近"干声" |
| 翻唱练习、伴奏制作 | HP2 或 HP3,聚合度保持 10,输出 wav 或 flac | 人声轨干净可直接当练习原声;漏伴奏多就换 HP3 并上调聚合度 |
| 语音数据集清洗 | HP3,格式转 flac,聚合度 10 | 得到去除了背景与人声分离后的主人声轨,可直接进数据集目录 |
翻唱与伴奏这一档里,HP2 与 HP3 的取舍就一句:怕漏伴奏选 HP2,怕人声受损选 HP3,二选一即可。
UVR5 跑不动时怎么排查
- 现象:模型加载失败,下拉框是空的。可能原因:
assets/uvr5_weights/下缺少对应.pth或文件下载不完整。处理方式:重跑 tools/dlmodels.sh,或用 tools/download_models.py 单独补齐权重。 - 现象:进程卡死或直接退出。可能是内存不足。处理方式:关掉其他程序,单批只放 1~2 个文件,聚合度调到 10 以下;仍不行就改用 CPU 模式,速度换稳定。
- 现象:某个文件报错或输出无声。常见原因是格式不匹配。处理流程:先用 ffmpeg 转成 44.1kHz 立体声 wav 再重试,UVR5 推理前本就会做统一重采样,预转一次能少踩坑。
- 现象:GPU 上跑报显存不足(out of memory)。处理方式:单文件逐个处理、降低聚合度;长音频分段;必要时退回 CPU。
- 现象:Linux / macOS 上
run.sh拒绝启动。脚本只支持 Python 3.8 且不支持 Windows,处理方式是确认系统里装有 Python 3.8 再执行;Windows 请直接用go-web.bat。
低配电脑跑 UVR5:按内存和显卡定参数
- 低配(4~8GB 内存、核显或入门独显):HP2,聚合度 5–8,单批 1 个文件,显存紧张时直接 CPU。
- 中配(8GB 内存、入门级独显):HP3,聚合度 10–12,单批 3–5 个文件。
- 高配(16GB 内存、中高端独显):HP3 或 MDX-Net + DeEcho 组合链,聚合度 15–20,单批 5–10 个文件。
分离逻辑与参数入口集中在 infer/modules/uvr5/,界面文案与使用说明见 docs/。权重齐了、参数按档位落好,这套流程就能稳定产出干净的人声轨,够日常播客、翻唱和数据集清洗反复使用。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考