UVR5 人声分离与伴奏提取快速上手:免费 AI 分轨参数调校与排障指南
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
剪视频想用一首流行歌当 BGM,人声总在画面上方抢戏?这个需求有个免费解法:Ultimate Vocal Remover(UVR5)是一款开源 AI 人声分离工具,把音频一键拆成伴奏与干声,图形界面操作,不需要任何音频工程背景。
十分钟装好,拿到第一版伴奏
界面长这样:左侧放输入输出与格式,中间是算法、模型和参数,底部只有一个 Start Processing 按钮。
从零到第一版伴奏,做这几件事就行:
- 安装二选一。官方一体化安装包内置 Python、PyTorch、FFmpeg,装完即用;源码运行则克隆仓库装依赖:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui pip install -r requirements.txt- NVIDIA 显卡用户补一步,把 PyTorch 升到 CUDA 版,推理速度通常提升数倍:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117- 首次运行会自动下载模型,等它下完再操作。
- 点 Select Input 选音频,Select Output 指定保存目录,输出格式选 WAV 或 FLAC。
- 算法保持 MDX-Net(一种两轨分离网络,出活快),模型选 MDX23C-InstVoc HQ,标准的人声/伴奏双轨模型。
- 参数不动,用默认值:SEGMENT SIZE 256、OVERLAP 8,有显卡就勾 GPU Conversion,然后 Start Processing。💡 想先验证效果,勾上 Sample Mode (30s),程序只处理前 30 秒,确认满意再跑全长。
跑完后输出目录出现两个文件:歌曲名_(Vocals).wav是干声,歌曲名_(Instrumental).wav就是你要的伴奏。
一分钟原理:AI 按声源分离,不按频率切
传统软件"消人声"按钮出来的声音闷而空,因为它用固定滤波器把 vocals 集中出现的频段直接挖掉,可人声与吉他、键盘的泛音正叠在那个频段上,挖频等于连乐器一起挖。AI 模型靠大量标注音频学会另一件事:人声和各乐器在时间与频率上分别以什么形态出现。UVR5 的三个算法家族都是按"声源"拆混音,先估计每个声源的贡献,再各自成轨。所以伴奏不是被"挖"出来的,而是被"拆"下来的,空间感和细节都保得住。
按素材类型挑算法与模型
三种算法家族、三种拆法,UVR5 把它们装进同一个窗口,各带独立模型目录:
- MDX-Net,源码在 lib_v5/mdxnet.py:推理快,两轨人声/伴奏拆分稳定;
- Demucs v3/v4,源码在 demucs/:支持人声/鼓/贝斯/其他四轨拆分;
- VR 架构,模型配置在
lib_v5/vr_network/:模型版本多,专项去乐器、降噪都有。
模型文件落在 models/ 下三个子目录:models/MDX_Net_Models/(各模型的 yaml 配置在mdx_c_configs子目录里)、models/Demucs_Models/、models/VR_Models/(自带UVR-DeNoise-Lite.pth,可先做一遍降噪)。首次运行自动下载,网络不顺畅就手动把文件丢进对应目录。
对号入座即可:
| 素材类型 | 推荐算法/模型 | 关键参数 |
|---|---|---|
| 流行/摇滚,日常要伴奏 | MDX-Net,MDX23C-InstVoc HQ | Segment Size 256 / Overlap 8 |
| 编曲复杂,要鼓、贝斯分轨 | Demucs v4 | 四轨拆分,参数保持默认 |
| 只想去掉特定乐器 | VR,4band_44100 No Piano | 有接缝时把 overlap 调大 |
| 素材本身底噪大 | 先用 VR 的 UVR-DeNoise-Lite.pth 降噪再分离 | 降噪后按原参数处理 |
两个参数决定质量与速度的取舍:Segment Size(分段大小)是 AI 每次推理的窗口长度,选 128 省内存、适合老设备,512 质量更好但吃显存;Overlap(重叠率)控制相邻窗口的重叠程度,太小会有接缝和咔哒声,越大拼接越自然,耗时也越长。
⚡ 提速技巧与排障自查
设备调度逻辑写在 separate.py:自动检测 NVIDIA 的 CUDA 与 macOS 的 MPS,可用就走 GPU。AI 推理是计算密集型任务,有显卡时,5 分钟音频能从十几分钟压到一两分钟。文件多的时候,界面里可以直接排队批量处理,也可以写个小脚本遍历目录、把文件逐个交给UVR.py,省掉手动点选。
常见症状对号入座:
| 症状 | 一句话对策 |
|---|---|
| CUDA out of memory | 调小 Segment Size,或取消 GPU Conversion |
| 输出有咔哒声、段落接缝 | Overlap 加到 16 或 24 |
| 模型下载失败或极慢 | 手动下载模型文件,放进 models/ 对应子目录 |
| 界面打不开 | 补装 tkinter/ffmpeg 依赖,或改用一体化安装包 |
挑一首你最熟悉的歌,用 UVR5 分出伴奏,再跟着录一版自己的演唱。结果有接缝就把 Overlap 加到 16,人声残留就换 Demucs v4 再跑一遍——两次小调整,通常就能得到一版干净得像官方发行的伴奏。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考