RVC 语音转换 Web UI:10 分钟录音就能训出你的 AI 歌手,4G 显存可跑
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
给短视频配音总怕声音"撞脸",直播开麦又想换个更有特色的音色?Retrieval-based-Voice-Conversion-WebUI(下称 RVC)是一个基于 VITS 的语音转换框架:你丢进10 到 50 分钟的录音,它就能训练出一个属于你的 AI 歌手模型。整个过程在浏览器里点按钮完成,不用写一行代码。这篇 RVC Web UI 教程带你从 clone 仓库走到第一条转换出来的音频,顺路把新手最容易卡住的坑一次讲清。
🎯 能力全景:先判断它值不值得你装
RVC 提供两套界面:训练推理界面(go-web.bat 启动)负责训练和批量转换,实时变声界面(go-realtime-gui.bat 启动)负责开麦即改。按场景看你能拿到什么:
| 场景 | 你能拿到什么 | 门槛 |
|---|---|---|
| 把自己的声音克隆给短视频、游戏配音 | 10-50 分钟低底噪录音训练出 60+MB 的模型文件,推理时音色纯净不串味 | 至少 4GB 显存的显卡,训练集 10 分钟起步 |
| 直播、游戏里实时换声音 | 端到端延迟 170ms,配 ASIO 声卡可到 90ms | 麦克风 + 扬声器,N/A/I 卡均可运行 |
| 处理整首歌曲再变声 | 内置 UVR5 人声分离模型,先拆人声再转换 | 需要先下载 uvr5_weights 权重 |
| 把两个模型音色调着玩 | 模型融合功能,可在 ckpt 选项卡里合并出混合音色 | 需要先训出至少两个模型 |
看完这张表:只要你有 4GB 显存、一小时的空闲时间,下面就能跑起来。
🧰 最小可跑路径:从清单到启动
硬件/系统清单(显存不足是最常见劝退点,先对号入座):
- 显存:4GB 是最低要求;3GB(如 GTX 1060 3G)基本没救
- Python:3.8 及以上
- 磁盘:约10GB可用空间(代码 + 预训练模型)
- 音频工具:FFmpeg,负责读写各种格式音频
1. 拉取代码——这一步把项目放到你电脑上:
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI2. 装依赖——按你的显卡选一份清单装。先装 PyTorch 全家桶:
pip install torch torchvision torchaudio然后按显卡选装:
pip install -r requirements.txt # N卡 pip install -r requirements-dml.txt # A卡 / I卡 pip install -r requirements-amd.txt # A卡 + ROCM(仅 Linux) pip install -r requirements-ipex.txt # I卡 + IPEX(仅 Linux)Windows 上 RTX 30 系(Ampere 架构)如果报错,换带 cu117 参数的安装命令指定 CUDA 版本即可。MacOS 用户直接一条命令:
sh ./run.sh3. 装 FFmpeg——RVC 靠它解码音频:
sudo apt install ffmpeg # Ubuntu / Debian brew install ffmpeg # MacOSWindows 用户把 ffmpeg.exe 和 ffprobe.exe 放进项目根目录就行。
4. 下载预训练模型——模型不下载,训练和推理都是空转。脚本会自动把 HuBERT 语音特征提取模型、VITS 预训练权重、UVR5 人声分离权重拉到 assets/ 目录:
sh tools/dlmodels.sh5. 下载 RMVPE 音高提取文件——RMVPE 是项目默认使用的音高提取算法,比旧方案更快、资源占用更小、不容易出现哑音。把rmvpe.pt放到项目根目录;A卡/I卡用户额外再放一份rmvpe.onnx。
6. 启动:
python infer-web.py浏览器打开http://localhost:7897就进入训练推理界面。Windows 用户也可以直接双击 go-web.bat 省去敲命令。
🎙️ 第一次实战:把 10 分钟录音变成你的 AI 歌手
装好之后别急着乱点,跑一遍最小真实流程:
- 准备素材:录10 分钟以上干净的人声(朗读、哼歌都行),底噪越小越好,存成一个文件夹。
- 打开训练选项卡,填实验名(比如
my-voice),勾选"是否考虑音高"——要做唱歌变声必须勾上。 - 填好训练集音频文件夹路径,点一键训练。程序会自动切分音频、提取音高和特征、训练模型、训练检索索引,全程看控制台滚动日志就行。
- 训练完成后,
weights/目录下会出现一个60+MB的.pth模型文件——这是你唯一需要保留和分享的模型。
接下来去推理界面:左侧选你的模型,右侧选目标音色,拖入一段你自己的录音,点推理,等几秒,输出目录里就多了一条 WAV。
成功的样子是这样的:人声轮廓像目标音色,咬字和节奏跟着你的原录音走,没有金属味和杂音。如果听着像"原音色和目标音色各占一半",把索引比例往上调(最大 1.0)再试。
🛠️ 避坑速查
| 现象 | 原因 | 你能做的动作 |
|---|---|---|
| Cuda out of memory | 显存不够,4GB 是下限 | 训练时把 batch size 降到 1;推理时调小 configs/config.py 末尾的x_pad、x_query、x_center、x_max |
| 一键训练结束却没有索引文件 | 训练集太大,加索引那步卡住 | 耐心等一会儿;长时间无响应就再点一次"训练索引" |
| Windows 报 llvmlite.dll 错误 | 缺微软 C++ 运行库 | 装上 vc_redist.x64.exe,重启电脑和 Web UI |
| 网页弹出 Expecting value: line 1 column 1 | 系统代理拦截了本地请求 | 关掉全局/局域网代理;远程机器的 http_proxy 也要 unset |
更多问题先翻 常见问题,那里有 18 条完整排查路径。
📖 深入方向
- 训练参数怎么调、音高算法怎么选:训练技巧文档
- 模型融合(把两个音色混成一个新的)源码在 infer/modules/vc/utils.py
- 想脱离网页、写脚本批处理:看 tools/infer_cli.py 和 tools/infer/infer-pm-index256.py
下一步
现在就去把 go-web.bat 双击起来,录一段 10 分钟的干净人声,今天就能听到自己的 AI 歌手。卡住了就回上面的避坑表查一遍,RVC 的坑都有标准答案。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考