Ultimate Vocal Remover 5.6 从 0 到 1:免费人声提取与伴奏制作完整指南
2026/9/5 19:25:57 网站建设 项目流程

Ultimate Vocal Remover 5.6 从 0 到 1:免费人声提取与伴奏制作完整指南

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

Ultimate Vocal Remover(UVR)5.6 是一个基于深度神经网络的音频分离图形界面工具,能把一首歌拆出人声、伴奏、鼓、贝斯等独立音轨,全程点选操作,不需要写代码。本文带你完成安装、跑通第一次分离,并给出可直接照抄的模型选择与参数组合,适合想做翻唱伴奏、提取干声或混音素材但没有编程背景的人。

先装起来:两种安装路径

如果你用 Windows 10+ 或 macOS(Big Sur 及以上),优先去 Release 页下载预编译安装包,它内置了 Python、PyTorch 等全部依赖,双击安装即可,无需任何前置条件。AMD Radeon 或 Intel Arc 显卡的 Windows 用户,选 OpenCL 版安装包。注意 Windows 版必须装在 C 盘,装到副盘会导致运行不稳定。

其他环境(Linux 等)用源码方式,先获取代码:

git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui

再装依赖。Debian / Arch 系 Linux 直接跑项目自带脚本:

chmod +x install_packages.sh && ./install_packages.sh

其余平台手动装:

pip install -r requirements.txt

最后启动,版本号 v5.6.0 会显示在窗口底部:

python3 UVR.py

一个容易踩的坑:输入文件如果不是 WAV,程序需要 FFmpeg 做转码。Windows 下把ffmpeg.exe解压放到应用根目录;Linux 用包管理器装 ffmpeg 即可。缺了它,非 WAV 输入会在转换环节直接失败。

第一次分离:按屏幕上的动线点过去

打开界面后从上往下就是完整操作顺序,一次点完:

  1. Select Input选源音频,点Select Output选结果保存目录。
  2. 选输出格式:WAV / FLAC / MP3 三个单选项,存档和后期建议 WAV,分发试听再选 MP3。
  3. CHOOSE PROCESS METHOD下拉框选方法(默认 MDX-Net),在CHOOSE MDX-NET MODEL选具体模型,默认MDX23C-InstVoc HQ可直接用。
  4. 右侧参数区保持默认:SEGMENT SIZE 256、OVERLAP 8、勾选GPU Conversion
  5. 点底部的Start Processing,右侧方块按钮可随时停止。

首次使用某个模型时会自动联网下载模型文件,第一次等待偏长属于正常现象。下载完的结果出现在你选的 Output 目录里,直接试听。

选模型:按你要的轨数来定,而不是按名字

主界面下拉框里四个方法对应不同的分离目标,选错方法比参数调错更影响结果:

方法输出适用场景
MDX-Net人声 / 伴奏两轨只想去人声或只要伴奏,二分质量优先
Demucs(v3 / v4)人声 / 鼓 / 贝斯 / 其他四轨重混音、多轨编曲,需要逐轨控制
VR Architecture按模型定(多为两轨)保留原曲质感、去杂音;自带降噪模型 UVR-DeNoise-Lite.pth,还有 "No Piano" 这类单乐器移除模型,清单见 models/VR_Models/model_data/
Ensemble Mode多模型混合同一轨用多个模型分别分离再混合,榨取极限质量

模型文件统一放在models/目录下的对应子目录(MDX_Net_Models / Demucs_Models / VR_Models),MDX-Net 的核心实现在 lib_v5/mdxnet.py,四轨拆分依赖的 demucs 代码在 demucs/ 目录,排错时可以从这里找。

如果效果不达预期,先换方法族再谈参数——比如用 MDX-Net 拆两轨发现残留重,直接切到 Demucs 看四轨结果,通常比反复调数字见效更快。

参数怎么调:三组数字解决 90% 的问题

参数区只有三个主要旋钮,记住以下组合即可:

  • 默认起步:Segment 256 / Overlap 8,GPU Conversion 打开。先用Sample Mode (30s)只跑 30 秒试听,确认模型选对了再跑全长。
  • 要最干净的人声:Segment 提到 512,Overlap 提到 16。Overlap 控制相邻预测窗的重叠量,越大段与段衔接越平滑,代价是耗时变长。
  • 显存或内存吃紧、报分配错误:Segment 降到 128 甚至 64;MDX-Net 和 VR Architecture 还可启用Batch Mode进一步省内存,或干脆取消 GPU Conversion 用 CPU 跑。

另外两个勾选框按需求用:Vocals OnlyInstrumental Only只输出单边音轨,省一半时间和磁盘。

硬件要求:对照你的机器看

  • NVIDIA 显卡:勾选 GPU Conversion 即启用 CUDA。官方最低配置为 RTX 1060 6GB,日常建议 8GB 以上显存。
  • AMD Radeon / Intel Arc(Windows):用 OpenCL 版安装包,当前版本对 AMD 的支持有限。
  • Apple M1 / M2(macOS):GPU Conversion 对应 MPS 加速,按官方说明支持 Demucs v4 与全部 MDX-Net 模型。
  • 纯 CPU:所有模型都能跑,内存建议 8GB 以上,速度取决于核心数。

出问题时查这张表

现象原因处理办法
非 WAV 文件处理报错缺少 FFmpeg安装 FFmpeg,Windows 下把 ffmpeg.exe 放到应用根目录
内存 / 显存分配错误Segment 或 Window 过大把 SEGMENT SIZE 调小(128 / 64),或改用 Batch Mode
首次运行模型下载失败网络不通用应用内的手动模型下载功能逐个补齐,模型放到models/对应子目录
macOS 装完打不开系统安全隔离终端执行sudo xattr -rd com.apple.quarantine /Applications/Ultimate\ Vocal\ Remover.app
GPU Conversion 没有提速非 NVIDIA 显卡或驱动问题换 OpenCL 版安装包,或取消勾选用 CPU 模式

界面左侧扳手图标是设置入口,报错后先在里面打开 Error Log 看完整堆栈,比只看弹窗信息定位更快。

进阶:把调好的配置存下来

  • 保存设置:参数调到位后,点SELECT SAVED SETTINGS旁的Choose Option保存一份,整套配置写入gui_data/saved_settings/,下次启动后从下拉框一键载入。
  • Ensemble 模式:用多个模型对同一轨分别分离再混合,组合配置存在gui_data/saved_ensembles/,适合对分离质量有极限要求的场景,但耗时成倍增加。
  • 输出格式:WAV 保真度最高适合存档,FLAC 是无损折中,MP3 只建议用于分发试听。

现在就能做的第一步

运行python3 UVR.py打开界面,选一首你熟悉的歌,保持默认 MDX-Net + MDX23C-InstVoc HQ,勾选Sample Mode (30s)后点Start Processing——听完这 30 秒的人声轨,再决定跑不跑全长。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询