RVC WebUI声音克隆实操教程:用10分钟音频做出属于你的AI变声模型
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
做视频配音时,想换一种声音念台词却不想重录?RVC WebUI 是一款开源的 AI 变声与声音克隆工具:你只需准备 10 到 30 分钟干净人声,就能训练出一个属于某个音色的模型,之后开口说话即输出该音色。本篇按"装环境 → 放模型 → 启动 → 训出第一个模型"的顺序逐步走完,全部命令可直接执行。
🔎 原理:检索式变声和普通调音高有什么区别
普通变声器只是整体抬高或压低音高,像把整首歌移调,音色信息会跟着失真。RVC WebUI 的做法类似"配音演员参考原声":它先把你 10 分钟以上的训练音频切成大量片段、存入特征库,推理时用 top1 检索找出与当前输入最接近的片段特征,再替换进合成流程。这样音高、情绪照搬你的输入,音色则稳定来自训练集,源音色不会"泄漏"到输出里。
✅ 开工前自检:先确认你的机器能不能跑
| 检查项 | 可运行的门槛 | 不达标的影响 |
|---|---|---|
| 显卡(NVIDIA) | 显存 4GB 起步(4GB 可用,6GB 以上更稳) | 4GB 以下显存建议放弃训练,仅推理或改用其他设备 |
| 显卡(AMD/Intel) | 走 DirectML 路线,Windows 下装requirements-dml.txt即可 | 只能单精度推理,速度偏慢 |
| 内存 | 16GB 建议值 | 训练集过大时索引步骤会卡住 |
| Python | 大于 3.8 | 依赖安装失败 |
| 依赖清单 | N 卡:requirements.txt;A 卡/I 卡:requirements-dml.txt | 装错清单会报 CUDA/DirectML 相关错误 |
先对照上表判断一次,再往下走,能省掉大半排障时间。
🛠 完整实操:五步训出第一个模型
第 1 步:克隆仓库
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI目的:拿到全部源码与脚本。看到终端输出仓库目录内容即成功。
第 2 步:装依赖
pip install torch torchvision torchaudio pip install -r requirements.txt第一条装 PyTorch 核心(已装可跳过),第二条按显卡装清单:A 卡/I 卡用户把文件换成requirements-dml.txt。无报错、最后返回命令提示符即成功。
第 3 步:放入预训练模型
python tools/download_models.py仓库内自带下载脚本,会拉取assets/hubert/hubert_base.pt、assets/pretrained/(v2 模型在assets/pretrained_v2/)以及 UVR5 人声分离权重。若用 RMVPE 音高算法,还需把rmvpe.pt放到项目根目录。看到 "All models downloaded!" 即成功。Windows 用户记得把 ffmpeg.exe 放在项目根目录。
第 4 步:启动 Web 界面
python infer-web.py终端会打印监听地址。浏览器打开http://localhost:7865出现训练/推理界面即启动成功(整合包的go-web.bat用 7897 端口,原理相同)。
第 5 步:训练第一个模型
在界面的"训练集格式化"页签放入 10 分钟以上低底噪人声,依次走完三步:
- 切分音频 + 提取音高特征(f0 算法选 rmvpe,效果最稳);
- 提取总特征;
- 填写训练设置:
total_epoch默认 20,音质好的训练集可提到 200;save_every_epoch默认 5;batch_size默认按显存自动给出,4GB 显存调成 1。
点击训练后,看到 logs/实验名下出现.pth文件、且 weights 文件夹下生成 60MB 以上的推理模型,即训练成功。训练完把该模型拖进"推理"页签,上传一段你自己的音频点合成,听到目标音色开口,整个闭环就跑通了。
🎛 参数速查:按目标选 f0_method 和 index_rate
| 目标 | f0_method | index_rate | 半精度 is_half | 说明 |
|---|---|---|---|---|
| 实时变声(低延迟优先) | rmvpe | 0.75 | True | 音高准、速度快;端到端延迟约 170ms,接 ASIO 设备可压到 90ms |
| 高音质录音(音质优先) | crepe | 0.5 | False | 精度最高但慢,适合离线合成 |
| 批量处理(效率优先) | pm | 0.8 | False(可放 CPU) | 最快的音高提取,算力占用最低 |
三条调优经验:
index_rate在 0.5~0.8 之间调,值越大越像目标音色,越小越保留你的原始说话方式。- 训练集底噪大时
total_epoch给 20~30 就够,调高只会放大底噪;音质高、时长足(10~50 分钟)才值得拉到 200 左右。 - 4GB 以下显存的卡会自动被程序切成 fp32,此时不要手动追求半精度,先保证跑得动。
🩺 排障清单:现象 → 最可能原因 → 解决动作
- 浏览器打不开界面 / 提示 Connection Error→ 控制台黑窗口被关了,或系统代理拦截 → 保持终端窗口存活;关闭全局代理后重启。
- 处理音频时报 ffmpeg error 或 utf8 error→ 文件路径含空格、括号或中文 → 把音频挪到纯英文、无空格的路径再切分。
- 训练或推理报 CUDA out of memory→ 显存不足 → 训练把
batch_size降到 1;推理则调小configs/config.py末尾的x_pad、x_query、x_max。 - 音色有机械感、不自然→ 训练数据不足或参数不匹配 → 数据补到 20 分钟以上,
index_rate在 0.5~0.8 间微调,换一种 f0 算法对比。 - 训练显示完成但找不到索引文件→ 训练集过大卡在加索引步骤 → 再次点击"训练索引"按钮即可。
下一步:用训好的.pth加.index到实时变声界面(gui_v1.py)跑一遍麦克风,验证端到端延迟显示。遇到问题按顺序查 docs/cn/faq.md 的问答、configs/ 下的采样率配置,以及 docs/en/README.en.md 的英文对照说明。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考