Ultimate Vocal Remover 5.6 从 0 到 1:免费人声提取与伴奏制作完整指南
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
Ultimate Vocal Remover(UVR)5.6 是一个基于深度神经网络的音频分离图形界面工具,能把一首歌拆出人声、伴奏、鼓、贝斯等独立音轨,全程点选操作,不需要写代码。本文带你完成安装、跑通第一次分离,并给出可直接照抄的模型选择与参数组合,适合想做翻唱伴奏、提取干声或混音素材但没有编程背景的人。
先装起来:两种安装路径
如果你用 Windows 10+ 或 macOS(Big Sur 及以上),优先去 Release 页下载预编译安装包,它内置了 Python、PyTorch 等全部依赖,双击安装即可,无需任何前置条件。AMD Radeon 或 Intel Arc 显卡的 Windows 用户,选 OpenCL 版安装包。注意 Windows 版必须装在 C 盘,装到副盘会导致运行不稳定。
其他环境(Linux 等)用源码方式,先获取代码:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui再装依赖。Debian / Arch 系 Linux 直接跑项目自带脚本:
chmod +x install_packages.sh && ./install_packages.sh其余平台手动装:
pip install -r requirements.txt最后启动,版本号 v5.6.0 会显示在窗口底部:
python3 UVR.py一个容易踩的坑:输入文件如果不是 WAV,程序需要 FFmpeg 做转码。Windows 下把ffmpeg.exe解压放到应用根目录;Linux 用包管理器装 ffmpeg 即可。缺了它,非 WAV 输入会在转换环节直接失败。
第一次分离:按屏幕上的动线点过去
打开界面后从上往下就是完整操作顺序,一次点完:
- 点Select Input选源音频,点Select Output选结果保存目录。
- 选输出格式:WAV / FLAC / MP3 三个单选项,存档和后期建议 WAV,分发试听再选 MP3。
- 在CHOOSE PROCESS METHOD下拉框选方法(默认 MDX-Net),在CHOOSE MDX-NET MODEL选具体模型,默认MDX23C-InstVoc HQ可直接用。
- 右侧参数区保持默认:SEGMENT SIZE 256、OVERLAP 8、勾选GPU Conversion。
- 点底部的Start Processing,右侧方块按钮可随时停止。
首次使用某个模型时会自动联网下载模型文件,第一次等待偏长属于正常现象。下载完的结果出现在你选的 Output 目录里,直接试听。
选模型:按你要的轨数来定,而不是按名字
主界面下拉框里四个方法对应不同的分离目标,选错方法比参数调错更影响结果:
| 方法 | 输出 | 适用场景 |
|---|---|---|
| MDX-Net | 人声 / 伴奏两轨 | 只想去人声或只要伴奏,二分质量优先 |
| Demucs(v3 / v4) | 人声 / 鼓 / 贝斯 / 其他四轨 | 重混音、多轨编曲,需要逐轨控制 |
| VR Architecture | 按模型定(多为两轨) | 保留原曲质感、去杂音;自带降噪模型 UVR-DeNoise-Lite.pth,还有 "No Piano" 这类单乐器移除模型,清单见 models/VR_Models/model_data/ |
| Ensemble Mode | 多模型混合 | 同一轨用多个模型分别分离再混合,榨取极限质量 |
模型文件统一放在models/目录下的对应子目录(MDX_Net_Models / Demucs_Models / VR_Models),MDX-Net 的核心实现在 lib_v5/mdxnet.py,四轨拆分依赖的 demucs 代码在 demucs/ 目录,排错时可以从这里找。
如果效果不达预期,先换方法族再谈参数——比如用 MDX-Net 拆两轨发现残留重,直接切到 Demucs 看四轨结果,通常比反复调数字见效更快。
参数怎么调:三组数字解决 90% 的问题
参数区只有三个主要旋钮,记住以下组合即可:
- 默认起步:Segment 256 / Overlap 8,GPU Conversion 打开。先用Sample Mode (30s)只跑 30 秒试听,确认模型选对了再跑全长。
- 要最干净的人声:Segment 提到 512,Overlap 提到 16。Overlap 控制相邻预测窗的重叠量,越大段与段衔接越平滑,代价是耗时变长。
- 显存或内存吃紧、报分配错误:Segment 降到 128 甚至 64;MDX-Net 和 VR Architecture 还可启用Batch Mode进一步省内存,或干脆取消 GPU Conversion 用 CPU 跑。
另外两个勾选框按需求用:Vocals Only或Instrumental Only只输出单边音轨,省一半时间和磁盘。
硬件要求:对照你的机器看
- NVIDIA 显卡:勾选 GPU Conversion 即启用 CUDA。官方最低配置为 RTX 1060 6GB,日常建议 8GB 以上显存。
- AMD Radeon / Intel Arc(Windows):用 OpenCL 版安装包,当前版本对 AMD 的支持有限。
- Apple M1 / M2(macOS):GPU Conversion 对应 MPS 加速,按官方说明支持 Demucs v4 与全部 MDX-Net 模型。
- 纯 CPU:所有模型都能跑,内存建议 8GB 以上,速度取决于核心数。
出问题时查这张表
| 现象 | 原因 | 处理办法 |
|---|---|---|
| 非 WAV 文件处理报错 | 缺少 FFmpeg | 安装 FFmpeg,Windows 下把 ffmpeg.exe 放到应用根目录 |
| 内存 / 显存分配错误 | Segment 或 Window 过大 | 把 SEGMENT SIZE 调小(128 / 64),或改用 Batch Mode |
| 首次运行模型下载失败 | 网络不通 | 用应用内的手动模型下载功能逐个补齐,模型放到models/对应子目录 |
| macOS 装完打不开 | 系统安全隔离 | 终端执行sudo xattr -rd com.apple.quarantine /Applications/Ultimate\ Vocal\ Remover.app |
| GPU Conversion 没有提速 | 非 NVIDIA 显卡或驱动问题 | 换 OpenCL 版安装包,或取消勾选用 CPU 模式 |
界面左侧扳手图标是设置入口,报错后先在里面打开 Error Log 看完整堆栈,比只看弹窗信息定位更快。
进阶:把调好的配置存下来
- 保存设置:参数调到位后,点SELECT SAVED SETTINGS旁的Choose Option保存一份,整套配置写入
gui_data/saved_settings/,下次启动后从下拉框一键载入。 - Ensemble 模式:用多个模型对同一轨分别分离再混合,组合配置存在
gui_data/saved_ensembles/,适合对分离质量有极限要求的场景,但耗时成倍增加。 - 输出格式:WAV 保真度最高适合存档,FLAC 是无损折中,MP3 只建议用于分发试听。
现在就能做的第一步
运行python3 UVR.py打开界面,选一首你熟悉的歌,保持默认 MDX-Net + MDX23C-InstVoc HQ,勾选Sample Mode (30s)后点Start Processing——听完这 30 秒的人声轨,再决定跑不跑全长。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考