UVR 5.6 完整教程:三步搞定人声提取与音频分离
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
Ultimate Vocal Remover(UVR)5.6 是一款免费开源的音频分离工具,用深度神经网络从一首歌里拆出人声、伴奏、鼓和贝斯。你不用写一行代码,点几个按钮就能拿到干净的人声轨或伴奏轨。无论你是想做清唱、去人声伴奏,还是四轨重混音,这份教程都适合你。
🚀 三步跑起来
第 1 步,把项目拿到本地。
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui && cd ultimatevocalremovergui这一步只是下载源码,UVR 是图形界面程序,后面的工作全靠它自带的UVR.py启动。
第 2 步,装好 Python 依赖。
pip3 install -r requirements.txtrequirements.txt 里锁定了 PyTorch、librosa 等全部依赖。注意:Linux 上处理非 WAV 文件还需要 FFmpeg(sudo apt install ffmpeg),Windows/macOS 用户直接装 Release 页的预编译包可跳过这一步。
第 3 步,启动并完成第一次分离。
python3 UVR.py窗口打开后,点Select Input选你的歌曲,点Select Output定保存位置,输出格式选WAV(保真度最高),然后点Start Processing。首次使用某模型时会自动下载模型文件,耐心等它跑完,到输出目录试听即可。
🎚️ 你的需求对应哪个模型
主界面的CHOOSE PROCESS METHOD下拉框决定用哪一族模型,三种需求对应三个选择:
- 只想要干净的人声或伴奏:选MDX-Net。它针对"人声 vs 伴奏"的二分做了专项优化,默认模型 MDX23C-InstVoc HQ 开箱即用,核心实现在 lib_v5/mdxnet.py。
- 要做四轨拆分(人声 / 鼓 / 贝斯 / 其他):选Demucs。demucs/ 目录下的模型一次跑出四轨,适合重混音和多轨编曲。
- 想保留原曲质感或只去掉某一件乐器:选VR Architecture。它的模型清单见 models/VR_Models/model_data/,除人声、伴奏外还有 "No Piano" 这类单乐器移除模型,以及自带目录的降噪模型 UVR-DeNoise-Lite.pth。
一句话记法:去人声找 MDX-Net,拆四轨找 Demucs,保真降噪找 VR Architecture。
⚙️ 照着抄的参数组合
不用逐个理解参数,按你的情况直接抄这三组:
- 先试跑再决定:Sample Mode勾选(只跑 30 秒样例),Segment Size256 /Overlap8 保持默认,GPU Conversion打开。代价:先花 30 秒听到局部效果,满意再跑全长。
- 要最干净的人声:Segment Size提到 512、Overlap提到 16。代价:重叠越大段间衔接越平滑,但耗时明显变长。
- 内存吃紧或报错:Segment Size降到 128 甚至 64,或取消GPU Conversion用 CPU 跑;同时勾选Batch Mode,MDX-Net 和 VR 两族都支持,更省内存。
参数拧到头效果仍不满意时,换模型族通常比继续调参数见效更快。
🖥️ 硬件与加速
- NVIDIA 显卡:勾选GPU Conversion启用 CUDA 加速,官方最低要求 RTX 1060 6GB,显存 8GB 以上体验最佳。
- AMD Radeon / Intel Arc:Windows 用户装 OpenCL 版安装包,当前版本对 AMD 的支持仍有限。
- Apple M1 / M2:GPU Conversion对应 MPS 加速,v5.6 已覆盖 Demucs v4 和全部 MDX-Net 模型。
- 纯 CPU:所有模型都能跑,速度取决于核心数,内存建议 8GB 以上,仅支持 64 位系统。
🛠️ 常见问题速查表
| 现象 | 原因 | 解法 |
|---|---|---|
| 处理非 WAV 文件报错 | 没装 FFmpeg | Linux 执行sudo apt install ffmpeg;Windows 把 ffmpeg.exe 放到应用根目录 |
| 内存分配错误 | Segment / Window 设得过大 | 调小Segment Size,或勾选Batch Mode后重试 |
| macOS 装完打不开 | 系统安全隔离限制 | 终端执行sudo xattr -rd com.apple.quarantine /Applications/Ultimate\ Vocal\ Remover.app |
| 首次运行模型下载失败 | 网络不通 | 用应用内的手动模型下载功能单独下载,再重新启动 |
| GPU Conversion没提速 | 显卡不是 NVIDIA | 改回 CPU 模式,或换 Windows 的 OpenCL 版安装包 |
📦 进阶技巧
- 保存常用配置:调好参数后通过菜单里的Select Saved Settings存一份,整套设置写入
gui_data/saved_settings/,下次一键载入。 - Ensemble 模式:同一轨用多个模型分别分离再混合,配置存在
gui_data/saved_ensembles/,适合追求极限分离质量的场景。 - 输出格式:存档和后期用 WAV,FLAC 是无损折中,MP3 只适合分发试听。
现在开始
运行python3 UVR.py,选一首你熟悉的歌,CHOOSE PROCESS METHOD保持默认的MDX-Net,勾上Sample Mode先跑 30 秒。试听效果满意,就取消勾选跑全长;不满意,再换 Demucs 或 VR Architecture 试试。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考