☰
FireRedTTS3部署指南:GPU配置、模型下载与常见报错排查清单
2026/10/11 13:34:00 网站建设 项目流程

【免费下载链接】FireRedTTS3

FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing

项目地址:https://gitcode.com/gh_mirrors/fi/FireRedTTS3
点击查看免费下载

FireRedTTS3是一个支持24 种语言、21 种中文方言的零样本语音克隆系统,同时内置指令式音色设计与语音编辑能力(Instruct 版)。本文是一份面向新手的FireRedTTS3 部署指南:从 GPU 配置、依赖安装、模型下载到 Gradio 演示界面启动,再到常见报错排查清单,跟着走一遍即可跑通。

一、先认识 FireRedTTS3:两大模型变体

FireRedTTS3 提供两个变体,部署流程完全一致,只是入口类不同(见 fireredtts3/core.py):

变体能力入口类
FireRedTTS3-Base零样本语音克隆:给一段参考音频 + 文本,即可用该声音合成任意文本FireRedTTS3
FireRedTTS3-Instruct在克隆之上,支持自然语言音色设计、语义编辑(增删改词)、声学编辑(语速/音高/音量)FireRedTTS3Instruct

架构图解读:音频先由 RedAE 编码为连续表示,再由 Qwen3 骨干 Transformer 自回归预测,最后经 DiT + Decoder 还原为 24kHz 波形。Instruct 版额外支持文本指令注入。

二、FireRedTTS3 部署前的 GPU 配置与软件要求

这是新手最容易卡住的环节,先看这张硬件清单 ✅

硬件要求

  • 必须有 NVIDIA GPU(CUDA):代码中设备被固定为torch.device('cuda')(fireredtts3/llm/fireredtts3_base.py),不支持纯 CPU 运行。
  • 推荐 Ampere 架构及以上显卡(RTX 30 系 / A100 等):推理使用bfloat16自动混合精度(fireredtts3/llm/fireredtts3_base.py),老架构 GPU 对 bf16 支持不佳。
  • 显存建议 16GB 起步:骨干 LLM 为 Qwen3-1.7B(bf16),再叠加 RedAE、PatchEncoder、DiT 与 KV Cache。12GB 显存可尝试,长文本/Instruct 版建议留足余量。

软件要求

依赖版本在 requirements.txt 中锁定,关键是:

  • torch==2.8.0/torchaudio==2.8.0(需选择与你 CUDA 驱动匹配的 CUDA 版本)
  • flash_attn==2.8.3(需与 torch、CUDA 版本匹配编译)
  • transformers==5.6.2、wetext、fasttext、faster-whisper等

安装命令(先克隆仓库):

git clone https://gitcode.com/gh_mirrors/fi/FireRedTTS3 cd FireRedTTS3 pip install -r requirements.txt pip install gradio # 可选,仅 Web 演示需要

三、模型下载:3 步拿到预训练权重

权重托管在 Hugging Face 与 ModelScope,任选其一下载到pretrained_models/目录:

# 方式 1:hf CLI pip install "huggingface_hub[cli]" hf download FireRedTeam/FireRedTTS3 --local-dir pretrained_models/ # 方式 2:ModelScope pip install modelscope modelscope download --model FireRedTeam/FireRedTTS3 --local_dir pretrained_models/

下载完成后,用下面的目录清单核对是否完整(路径检查逻辑见 fireredtts3/llm/fireredtts3_base.py):

pretrained_models/ ├── redae/ # 语音编解码器 ├── fireredtts3_base/ # Base 变体核心模型 ├── fireredtts3_instruct/ # Instruct 变体核心模型 ├── text_tokenizer/ # 文本分词器 └── campp/campplus_voxceleb.bin # 说话人嵌入模型

💡 只要缺少其中任意一项,初始化时就会抛出xxx not found断言错误——这是第一类最高频报错。

四、可选配置:语种识别与文本归一化(TN)

  • 自动语种识别:Base 版对显式语言标签最敏感;若不想手动指定语言,可下载 Meta FastText 的lid.176.ftz语言识别模型放入fireredtts3/utils/llm_tn/models/(下载地址见 README.md Quick Start 章节)。未下载时仅打印[WARN]警告,不影响手动指定语种。
  • 文本归一化 TN:默认使用本地wetext(仅支持中/英)。若要覆盖日语、俄语等全部语言,可启用 LLM 版 TN:复制 .env.example 为.env,填入LLM_TN_API_URL、LLM_TN_API_KEY、LLM_TN_MODEL(建议 ≥30B 参数量的模型)。注意 LLM TN 需要联网调用外部 API,非必需项。

五、最快启动方式:Gradio Web 演示界面

无需写代码,两条命令即可启动(参数定义见 gradio_base.py):

# Base 版:多语言 / 方言零样本克隆 python gradio_base.py --host "0.0.0.0" --port 7860 # Instruct 版:音色设计 + 语音编辑 python gradio_instruct.py --host "0.0.0.0" --port 7860

启动后访问http://0.0.0.0:7860。若部署在反向代理(如 Remote VS Code)后面,需追加--root-path参数。

💡 小贴士:合成克隆效果最好时,参考音频的语种应与目标文本一致(合成日语就用日语参考音频)。界面中 CFG 值越高越贴近参考音色,越低变化越大。

六、FireRedTTS3 常见报错排查清单 🔧

#报错现象原因解决方案
1AssertionError: pretrained_models/redae not found等权重没下载完、或传入的模型目录路径不对核对第三节目录清单;确认初始化参数为"pretrained_models"
2flash_attn安装/导入失败版本与 torch / CUDA 不匹配按 requirements.txt 锁定 torch 2.8.0 后重装对应 CUDA 的 flash-attn 2.8.3
3No CUDA GPUs are available装了 CPU 版 PyTorch 或驱动版本过低重装 CUDA 版 torch:pip install torch==2.8.0 torchaudio==2.8.0 --index-url对应 CUDA 源
4CUDA out of memory显存不足升级显卡或缩小文本长度;1.7B bf16 骨干 + DiT 建议 16GB 显存
5invalid language: xxx(fireredtts3_base.py)语种标签不在 24 语言 + 21 方言列表内使用列表内标签,方言以ZH_前缀,如ZH_Sichuan
6[WARN] Failed to init llm_tn ...未下载 FastTextlid.176.ftz仅影响自动语种识别;手动指定language可忽略,或按 README 下载模型
7llm_tn requires LLM API credentials选了 LLM TN 但未配置.env复制 .env.example 为.env填好三件套,或改用本地wetext
8wetext normalization failed, fallback to raw textTN 失败自动回退原文(fireredtts3/core.py)非致命警告,输出仍可生成;数字/日期可能读得不自然
9Port 7860 is already in use/ 代理环境打不开页面端口被占用或未配代理路径换--port;代理环境加--root-path(见 README.md Gradio Demo 章节)
10Gradio 报Check text/prompt audio/prompt text!必填输入为空(gradio_base.py)上传参考音频并填写其文本、待合成文本

七、收尾:3 个避坑要点

  1. 路径三原则:代码在仓库根目录运行、权重放在pretrained_models/、.env也在根目录——三者对齐可消灭 80% 的初始化错误。
  2. 语种显式指定更稳:把language传成具体标签(如Japanese),比依赖自动检测效果更可控。
  3. 克隆≠随意使用:语音克隆能力仅供学术研究,请勿用于任何非法用途(见 LICENSE,项目采用 Apache-2.0 协议)。

按照以上步骤,你应当已经完成FireRedTTS3 部署:GPU 就绪、权重就位、界面可交互。若遇到本文清单之外的报错,优先对照 README.md 的 Quick Start 章节逐行核对命令与参数。

【免费下载链接】FireRedTTS3

FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing

项目地址:https://gitcode.com/gh_mirrors/fi/FireRedTTS3
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询