☰
RVC WebUI声音克隆实操教程:用10分钟音频做出属于你的AI变声模型
2026/9/29 22:44:53 网站建设 项目流程

RVC WebUI声音克隆实操教程:用10分钟音频做出属于你的AI变声模型

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

做视频配音时,想换一种声音念台词却不想重录?RVC WebUI 是一款开源的 AI 变声与声音克隆工具:你只需准备 10 到 30 分钟干净人声,就能训练出一个属于某个音色的模型,之后开口说话即输出该音色。本篇按"装环境 → 放模型 → 启动 → 训出第一个模型"的顺序逐步走完,全部命令可直接执行。

🔎 原理:检索式变声和普通调音高有什么区别

普通变声器只是整体抬高或压低音高,像把整首歌移调,音色信息会跟着失真。RVC WebUI 的做法类似"配音演员参考原声":它先把你 10 分钟以上的训练音频切成大量片段、存入特征库,推理时用 top1 检索找出与当前输入最接近的片段特征,再替换进合成流程。这样音高、情绪照搬你的输入,音色则稳定来自训练集,源音色不会"泄漏"到输出里。

✅ 开工前自检:先确认你的机器能不能跑

检查项可运行的门槛不达标的影响
显卡(NVIDIA)显存 4GB 起步(4GB 可用,6GB 以上更稳)4GB 以下显存建议放弃训练,仅推理或改用其他设备
显卡(AMD/Intel)走 DirectML 路线,Windows 下装requirements-dml.txt即可只能单精度推理,速度偏慢
内存16GB 建议值训练集过大时索引步骤会卡住
Python大于 3.8依赖安装失败
依赖清单N 卡:requirements.txt;A 卡/I 卡:requirements-dml.txt装错清单会报 CUDA/DirectML 相关错误

先对照上表判断一次,再往下走,能省掉大半排障时间。

🛠 完整实操:五步训出第一个模型

第 1 步:克隆仓库

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI

目的:拿到全部源码与脚本。看到终端输出仓库目录内容即成功。

第 2 步:装依赖

pip install torch torchvision torchaudio pip install -r requirements.txt

第一条装 PyTorch 核心(已装可跳过),第二条按显卡装清单:A 卡/I 卡用户把文件换成requirements-dml.txt。无报错、最后返回命令提示符即成功。

第 3 步:放入预训练模型

python tools/download_models.py

仓库内自带下载脚本,会拉取assets/hubert/hubert_base.pt、assets/pretrained/(v2 模型在assets/pretrained_v2/)以及 UVR5 人声分离权重。若用 RMVPE 音高算法,还需把rmvpe.pt放到项目根目录。看到 "All models downloaded!" 即成功。Windows 用户记得把 ffmpeg.exe 放在项目根目录。

第 4 步:启动 Web 界面

python infer-web.py

终端会打印监听地址。浏览器打开http://localhost:7865出现训练/推理界面即启动成功(整合包的go-web.bat用 7897 端口,原理相同)。

第 5 步:训练第一个模型

在界面的"训练集格式化"页签放入 10 分钟以上低底噪人声,依次走完三步:

  1. 切分音频 + 提取音高特征(f0 算法选 rmvpe,效果最稳);
  2. 提取总特征;
  3. 填写训练设置:total_epoch默认 20,音质好的训练集可提到 200;save_every_epoch默认 5;batch_size默认按显存自动给出,4GB 显存调成 1。

点击训练后,看到 logs/实验名下出现.pth文件、且 weights 文件夹下生成 60MB 以上的推理模型,即训练成功。训练完把该模型拖进"推理"页签,上传一段你自己的音频点合成,听到目标音色开口,整个闭环就跑通了。

🎛 参数速查:按目标选 f0_method 和 index_rate

目标f0_methodindex_rate半精度 is_half说明
实时变声(低延迟优先)rmvpe0.75True音高准、速度快;端到端延迟约 170ms,接 ASIO 设备可压到 90ms
高音质录音(音质优先)crepe0.5False精度最高但慢,适合离线合成
批量处理(效率优先)pm0.8False(可放 CPU)最快的音高提取,算力占用最低

三条调优经验:

  • index_rate在 0.5~0.8 之间调,值越大越像目标音色,越小越保留你的原始说话方式。
  • 训练集底噪大时total_epoch给 20~30 就够,调高只会放大底噪;音质高、时长足(10~50 分钟)才值得拉到 200 左右。
  • 4GB 以下显存的卡会自动被程序切成 fp32,此时不要手动追求半精度,先保证跑得动。

🩺 排障清单:现象 → 最可能原因 → 解决动作

  • 浏览器打不开界面 / 提示 Connection Error→ 控制台黑窗口被关了,或系统代理拦截 → 保持终端窗口存活;关闭全局代理后重启。
  • 处理音频时报 ffmpeg error 或 utf8 error→ 文件路径含空格、括号或中文 → 把音频挪到纯英文、无空格的路径再切分。
  • 训练或推理报 CUDA out of memory→ 显存不足 → 训练把batch_size降到 1;推理则调小configs/config.py末尾的x_pad、x_query、x_max。
  • 音色有机械感、不自然→ 训练数据不足或参数不匹配 → 数据补到 20 分钟以上,index_rate在 0.5~0.8 间微调,换一种 f0 算法对比。
  • 训练显示完成但找不到索引文件→ 训练集过大卡在加索引步骤 → 再次点击"训练索引"按钮即可。

下一步:用训好的.pth加.index到实时变声界面(gui_v1.py)跑一遍麦克风,验证端到端延迟显示。遇到问题按顺序查 docs/cn/faq.md 的问答、configs/ 下的采样率配置,以及 docs/en/README.en.md 的英文对照说明。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询