【免费下载链接】FireRedTTS3
FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing
FireRedTTS3是一个支持24 种语言、21 种中文方言的零样本语音克隆系统,同时内置指令式音色设计与语音编辑能力(Instruct 版)。本文是一份面向新手的FireRedTTS3 部署指南:从 GPU 配置、依赖安装、模型下载到 Gradio 演示界面启动,再到常见报错排查清单,跟着走一遍即可跑通。
一、先认识 FireRedTTS3:两大模型变体
FireRedTTS3 提供两个变体,部署流程完全一致,只是入口类不同(见 fireredtts3/core.py):
| 变体 | 能力 | 入口类 |
|---|---|---|
| FireRedTTS3-Base | 零样本语音克隆:给一段参考音频 + 文本,即可用该声音合成任意文本 | FireRedTTS3 |
| FireRedTTS3-Instruct | 在克隆之上,支持自然语言音色设计、语义编辑(增删改词)、声学编辑(语速/音高/音量) | FireRedTTS3Instruct |
架构图解读:音频先由 RedAE 编码为连续表示,再由 Qwen3 骨干 Transformer 自回归预测,最后经 DiT + Decoder 还原为 24kHz 波形。Instruct 版额外支持文本指令注入。
二、FireRedTTS3 部署前的 GPU 配置与软件要求
这是新手最容易卡住的环节,先看这张硬件清单 ✅
硬件要求
- 必须有 NVIDIA GPU(CUDA):代码中设备被固定为
torch.device('cuda')(fireredtts3/llm/fireredtts3_base.py),不支持纯 CPU 运行。 - 推荐 Ampere 架构及以上显卡(RTX 30 系 / A100 等):推理使用
bfloat16自动混合精度(fireredtts3/llm/fireredtts3_base.py),老架构 GPU 对 bf16 支持不佳。 - 显存建议 16GB 起步:骨干 LLM 为 Qwen3-1.7B(bf16),再叠加 RedAE、PatchEncoder、DiT 与 KV Cache。12GB 显存可尝试,长文本/Instruct 版建议留足余量。
软件要求
依赖版本在 requirements.txt 中锁定,关键是:
torch==2.8.0/torchaudio==2.8.0(需选择与你 CUDA 驱动匹配的 CUDA 版本)flash_attn==2.8.3(需与 torch、CUDA 版本匹配编译)transformers==5.6.2、wetext、fasttext、faster-whisper等
安装命令(先克隆仓库):
git clone https://gitcode.com/gh_mirrors/fi/FireRedTTS3 cd FireRedTTS3 pip install -r requirements.txt pip install gradio # 可选,仅 Web 演示需要三、模型下载:3 步拿到预训练权重
权重托管在 Hugging Face 与 ModelScope,任选其一下载到pretrained_models/目录:
# 方式 1:hf CLI pip install "huggingface_hub[cli]" hf download FireRedTeam/FireRedTTS3 --local-dir pretrained_models/ # 方式 2:ModelScope pip install modelscope modelscope download --model FireRedTeam/FireRedTTS3 --local_dir pretrained_models/下载完成后,用下面的目录清单核对是否完整(路径检查逻辑见 fireredtts3/llm/fireredtts3_base.py):
pretrained_models/ ├── redae/ # 语音编解码器 ├── fireredtts3_base/ # Base 变体核心模型 ├── fireredtts3_instruct/ # Instruct 变体核心模型 ├── text_tokenizer/ # 文本分词器 └── campp/campplus_voxceleb.bin # 说话人嵌入模型💡 只要缺少其中任意一项,初始化时就会抛出
xxx not found断言错误——这是第一类最高频报错。
四、可选配置:语种识别与文本归一化(TN)
- 自动语种识别:Base 版对显式语言标签最敏感;若不想手动指定语言,可下载 Meta FastText 的
lid.176.ftz语言识别模型放入fireredtts3/utils/llm_tn/models/(下载地址见 README.md Quick Start 章节)。未下载时仅打印[WARN]警告,不影响手动指定语种。 - 文本归一化 TN:默认使用本地
wetext(仅支持中/英)。若要覆盖日语、俄语等全部语言,可启用 LLM 版 TN:复制 .env.example 为.env,填入LLM_TN_API_URL、LLM_TN_API_KEY、LLM_TN_MODEL(建议 ≥30B 参数量的模型)。注意 LLM TN 需要联网调用外部 API,非必需项。
五、最快启动方式:Gradio Web 演示界面
无需写代码,两条命令即可启动(参数定义见 gradio_base.py):
# Base 版:多语言 / 方言零样本克隆 python gradio_base.py --host "0.0.0.0" --port 7860 # Instruct 版:音色设计 + 语音编辑 python gradio_instruct.py --host "0.0.0.0" --port 7860启动后访问http://0.0.0.0:7860。若部署在反向代理(如 Remote VS Code)后面,需追加--root-path参数。
💡 小贴士:合成克隆效果最好时,参考音频的语种应与目标文本一致(合成日语就用日语参考音频)。界面中 CFG 值越高越贴近参考音色,越低变化越大。
六、FireRedTTS3 常见报错排查清单 🔧
| # | 报错现象 | 原因 | 解决方案 |
|---|---|---|---|
| 1 | AssertionError: pretrained_models/redae not found等 | 权重没下载完、或传入的模型目录路径不对 | 核对第三节目录清单;确认初始化参数为"pretrained_models" |
| 2 | flash_attn安装/导入失败 | 版本与 torch / CUDA 不匹配 | 按 requirements.txt 锁定 torch 2.8.0 后重装对应 CUDA 的 flash-attn 2.8.3 |
| 3 | No CUDA GPUs are available | 装了 CPU 版 PyTorch 或驱动版本过低 | 重装 CUDA 版 torch:pip install torch==2.8.0 torchaudio==2.8.0 --index-url对应 CUDA 源 |
| 4 | CUDA out of memory | 显存不足 | 升级显卡或缩小文本长度;1.7B bf16 骨干 + DiT 建议 16GB 显存 |
| 5 | invalid language: xxx(fireredtts3_base.py) | 语种标签不在 24 语言 + 21 方言列表内 | 使用列表内标签,方言以ZH_前缀,如ZH_Sichuan |
| 6 | [WARN] Failed to init llm_tn ... | 未下载 FastTextlid.176.ftz | 仅影响自动语种识别;手动指定language可忽略,或按 README 下载模型 |
| 7 | llm_tn requires LLM API credentials | 选了 LLM TN 但未配置.env | 复制 .env.example 为.env填好三件套,或改用本地wetext |
| 8 | wetext normalization failed, fallback to raw text | TN 失败自动回退原文(fireredtts3/core.py) | 非致命警告,输出仍可生成;数字/日期可能读得不自然 |
| 9 | Port 7860 is already in use/ 代理环境打不开页面 | 端口被占用或未配代理路径 | 换--port;代理环境加--root-path(见 README.md Gradio Demo 章节) |
| 10 | Gradio 报Check text/prompt audio/prompt text! | 必填输入为空(gradio_base.py) | 上传参考音频并填写其文本、待合成文本 |
七、收尾:3 个避坑要点
- 路径三原则:代码在仓库根目录运行、权重放在
pretrained_models/、.env也在根目录——三者对齐可消灭 80% 的初始化错误。 - 语种显式指定更稳:把
language传成具体标签(如Japanese),比依赖自动检测效果更可控。 - 克隆≠随意使用:语音克隆能力仅供学术研究,请勿用于任何非法用途(见 LICENSE,项目采用 Apache-2.0 协议)。
按照以上步骤,你应当已经完成FireRedTTS3 部署:GPU 就绪、权重就位、界面可交互。若遇到本文清单之外的报错,优先对照 README.md 的 Quick Start 章节逐行核对命令与参数。
【免费下载链接】FireRedTTS3
FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing
相关推荐
PaddlePaddle GPU环境配置与常见错误排查指南
PaddlePaddle GPU环境配置与常见错误排查指南 引言 在使用PaddlePaddle深度学习框架进行GPU加速训练时,环境配置不当是导致运行错误的常
人工智能深度学习机器学习分布式训练预训练推理引擎算子库高性能计算Plane 项目管理平台新手指南:从本地部署到建出第一个看板
Plane 项目管理平台新手指南:从本地部署到建出第一个看板 如果你也受够过"项目管理工具比项目本身还难管"的体验,或者数据必须留在自己服务器上,Plane 会
项目管理后端前端研发协作需求管理SDXL模型部署检查清单
SDXL模型部署检查清单 环境配置 PaddlePaddle版本 ≥ 2.5.1 所有依赖库版本匹配requirements sdxl.txt 系统内存 ≥ 1
人工智能大模型多模态预训练微调媒体生成
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考