☰
10分钟语音快速训练AI变声:RVC WebUI完整上手教程
2026/10/4 23:15:32 网站建设 项目流程

10分钟语音快速训练AI变声:RVC WebUI完整上手教程

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

想用自己的声音翻唱一首歌,或者给播客、短视频配一个固定的声音?Retrieval-based-Voice-Conversion-WebUI(简称 RVC)是一款基于 VITS 的免费开源变声框架:你提供 10 分钟左右的清晰人声,它就能训练出一个可用于唱歌和说话的音色模型,训练、推理、实时变声全部在网页界面里完成。适合音乐创作者、视频作者,以及没有深度学习背景但想做出自己的 AI 声线的普通用户。

RVC 能帮你做什么

  • 小数据训练音色模型:官方建议 10 分钟到 50 分钟低底噪语音即可,得益于 top1 检索替换输入源特征,能减少音色泄漏
  • 网页界面一站式操作:数据预处理、特征提取、训练、索引生成都在 WebUI 里点按钮完成
  • 实时变声:端到端延迟约 170ms,使用 ASIO 输入输出设备可压到约 90ms
  • 人声伴奏分离:内置 UVR5,从歌曲里快速拆出人声
  • 模型融合:通过 ckpt 选项卡的 ckpt-merge 混合两个模型的音色
  • RMVPE 音高提取:较新的音高算法,能解决哑音问题,比 crepe_full 更快、占用更小
  • A 卡 / I 卡加速:支持 DML、ROCm、IPEX 三种后端

环境准备:显卡、Python 与依赖清单

先看你的显卡选依赖文件,Python 需要 3.8 以上版本:

显卡 / 系统依赖文件
N 卡(CUDA)requirements.txt
A 卡(ROCm,仅 Linux)requirements-amd.txt
A 卡 / I 卡(DML)requirements-dml.txt
I 卡(IPEX,仅 Linux)requirements-ipex.txt

显存方面,4GB 起步,低于 4GB 的显卡基本不建议尝试。

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txt

最后一条命令按上表换成你对应的文件。除了 Python 依赖,还需要两样东西:

  • ffmpeg:Ubuntu/Debian 执行sudo apt install ffmpeg,macOS 用brew install ffmpeg,Windows 下载 ffmpeg.exe 和 ffprobe.exe 放到项目根目录
  • 预训练模型:assets/hubert/hubert_base.pt、assets/pretrained、assets/uvr5_weights三个路径,tools目录里提供了下载脚本;想用 v2 底模还要额外下assets/pretrained_v2。RMVPE 音高模型的rmvpe.pt放在项目根目录

用 WebUI 训练第一个变声模型

数据怎么准备

安静环境、稳定距离录一段至少 10 分钟的清晰人声,避开背景音乐和破音,放进一个独立文件夹(建议放在项目assets下新建目录)。路径里不要有空格、括号或中文,否则会触发 ffmpeg 报错。

一键训练的操作步骤

启动方式按系统选:Windows 双击go-web.bat;Linux/Mac 执行sh ./run.sh或python infer-web.py。打开训练选项卡后,依次填写实验名、数据集路径、采样率(32k/40k/48k)、音高提取算法(推荐 rmvpe)、训练轮数和每张显卡的 batch_size,点一键训练。流程会自动走:提取音高和处理数据 → 训练模型(日志里能看到实时损失值)→ 训练索引。

终端打印Training is done. The program is closed.即训练成功,后面紧邻的报错可以忽略。

产物放在哪里

  • assets/weights/下出现约 60MB 的实验名.pth,这是用于推理的模型
  • 同名added_xxx.index是音色检索索引
  • logs/实验名/下的几百 MB pth 是实验状态存档,供复现或续训,不要拿它去推理或分享

结果验证与参数调整

怎么判断训好了

推理选项卡点刷新音色,列表里能选到你的实验名,说明模型已加载。上传一段测试音频转换后,如果音色不像,先查logs/实验名/下的训练日志,确认训练过程没有中断。

关键参数怎么调

参数建议值作用
total_epoch音质差底噪大时 20~30;音质高、时长多时可到 200训练轮数
batch_size按显存调,界面会按显存自动给默认值越大越快,越吃显存
f0up_key0 原调,+12 升八度,-12 降八度音高偏移
index_rate0.3~0.5调高更贴近训练集音色,调低更依赖底模
音高算法rmvpe效果最好且开销小

遇到异常怎么办

  • 显存不足(CUDA out of memory):训练就减小 batch_size;推理时调小 configs/config.py 末尾的x_pad、x_query、x_center、x_max
  • 训练结束没有索引文件:通常是索引步骤卡住,单独再点一次「训练索引」按钮
  • Connection Error:控制台黑窗口被关掉了,重新打开程序
  • WebUI 报 Expecting value:关掉系统的局域网/全局代理

更多情况可查 中文 FAQ。

进阶用法:批量转换、API 与分享模型

批量处理一批音频

界面不适合处理几百个文件时,用仓库自带的 tools/infer_batch_rvc.py:

python tools/infer_batch_rvc.py \ --input_path ./input_wavs \ --index_path ./assets/weights/added_IVF256_Flat_nprobe_1.index \ --model_name 实验名 \ --opt_path ./output \ --f0up_key 0 --f0method rmvpe --index_rate 0.5

注意它只处理目录里的.wav文件,输出写入--opt_path指定路径。

把实时变声做成服务

api_240604.py 是一个 FastAPI 实时变声服务,对外提供/inputDevices、/outputDevices、/config、/start、/stop几个接口,可以把它嵌进你自己的客户端,实现"选设备 → 推参数 → 开始/停止"的完整控制。

正确分享模型

把weights/实验名.pth(60MB 左右)和对应的added_xxx.index一起打包发出去,对方解压到 weights 目录刷新音色即可。千万不要分享logs/下的大 pth,直接拿去推理会报 key 不存在的错误。

常见问题

需要多少显存?4GB 起步,batch_size 为 2 时 6GB 足够。4GB 以下的显卡建议放弃训练。

训练多久合适?10 分钟数据在 RTX 3060 上约 1~2 小时。数据量越大越慢,但音质上限也越高。

ffmpeg 报错一定是 ffmpeg 的问题吗?大概率不是。先检查音频路径有没有空格、()或中文。

实时变声延迟高?换 ASIO 设备并把缓冲区调小,关闭后台占音频的程序。

中断的训练能接着跑吗?用相同实验名和参数重新启动,会从上次 checkpoint 继续;中途加数据则换新实验名并拷贝上次的 G/D 文件进去。

下一步

RVC 把"录 10 分钟声音 → 得到一个可用音色模型"这件事压缩到了几个按钮的距离。接下来做三件事:录一段 10 分钟干净人声、跑通第一次一键训练、用推理选项卡转换一首测试歌曲,跑通后再回来调 total_epoch 和 index_rate。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询